Входит в расширения:  Сервисы ИИ-инференса

Стадия жизненного цикла модуляExperimental

У модуля есть требования для установки

Модуль ai-inference даёт минимальный путь заказа инференса в Deckhouse Kubernetes Platform:

  1. Администратор кластера создаёт InferenceServiceClass — политики публикации, обязательный непустой modelPolicy.allowedEndpointTypes и, если нужно, acceleratorPolicy, ограничивающий устройства его заказов. Модуль поставляет встроенный default-llm.
  2. Пользователь namespace создаёт InferenceService из ссылки на класс, блока модели и опционально сужения перечня классов устройства: договор API платформа выбирает из перечня класса, а среду исполнения — из записи рецепта плана запуска.
  3. Контроллер проверяет заказ, разворачивает объекты его рабочей нагрузки сам и публикует status.endpoint.

Публичный API: группа ai.deckhouse.io/v1alpha1, виды InferenceServiceClass (cluster) и InferenceService (namespaced).

Компоненты модуля:

  • CRD и справочник CR — crds/, docs/CR*.md;
  • контроллер — образ controller, namespace d8-ai-inference;
  • Helm-шаблоны — templates/controller/**, user-authz и rbacv2.

Руководства:

Устройство и доводы за него — почему каждая часть сделана так, а не иначе: Пошаговый сценарий.

Пользовательские заметки о выпуске: Релизы.

Инженерная сторона хранилища — порождение кода, сценарии показа и дымовые сценарии, ночной круг подтверждения рецептов — предметом этих страниц не является.