Сервисы
ИИ-инференса
Запускайте ИИ‑модели как готовые сервисы: Deckhouse автоматически подбирает конфигурацию, масштабируется под нагрузку и контролирует работу каждого из них.
Платформа сама проверяет модель, развёртывает сервис и выдаёт адрес с ключом доступа. Интеграция ИИ в приложение происходит по одному заказу.
Выбирайте приоритет — минимальную задержку, максимальный поток запросов или баланс. Deckhouse подберёт GPU-профиль и параметры запуска.
«Сервисы ИИ-инференса» рассчитывают конфигурацию, а модуль управления GPU выделяет запрошенные устройства через DRA.
Число реплик меняется автоматически в заданных границах. В статусе и метриках видны готовность сервиса, реплики и причины возможных проблем.
Обработка запросов выполняется в инфраструктуре компании. Внутренняя или внешняя публикация, токен и TLS задаются политикой доступа.
Как Deckhouse запускает ИИ-модели
Пользователь создаёт InferenceService: выбирает модель из внутреннего каталога или указывает репозиторий Hugging Face напрямую, задаёт класс сервиса, режим работы и границы масштабирования. Перед запуском платформа проверяет доступность модели и правила класса, сопоставляет требования модели с актуальным инвентарём GPU.
По рассчитанному плану платформа запрашивает GPU через DRA, доставляет модель, создаёт рабочую нагрузку, настраивает механизм масштабирования и предоставляет API с ключом доступа.
Сервис переходит в статус Ready только после проверки рабочей нагрузки и ответа модели.
Работа с расширением
Рекомендуем в составе готовых решений
Проконсультируем по запуску ИИ-сервисов в вашей инфраструктуре
Поможем подобрать архитектуру под ваши задачи и покажем возможности Deckhouse для управления GPU и инференсом моделей.
Часто задаваемые вопросы
Расширение входит в состав редакции Deckhouse Platform Ultimate, а также доступно как дополнение к Deckhouse Platform Core.
Создайте сервис, выберите модель и режим работы. Deckhouse Platform проверит совместимость, подберёт ресурсы, запустит модель и предоставит адрес для подключения приложения.
Нет. Вы задаёте приоритет — минимальную задержку, максимальную пропускную способность или баланс, — а платформа подбирает конфигурацию из доступных ускорителей. Если ресурсов недостаточно, причина видна до запуска.
Вы задаёте минимальное и максимальное число реплик. Платформа автоматически меняет их количество под нагрузкой и показывает причины, если новая реплика не запускается.
Да. Запросы к модели обрабатываются в собственном контуре, а сервис можно оставить доступным только внутри компании. Если нужен внешний доступ, он защищается токеном и TLS.