Deckhouse Platform для искусственного интеллекта

Запускайте и сопровождайте ИИ⁠-⁠приложения на своих серверах.

1300 +
кластеров

под управлением Deckhouse

260 +
внедрений

в высоконагруженных ИТ⁠-⁠системах

Реестр
российского ПО

На чём можно сократить затраты

Deckhouse предоставляет общую инфраструктуру для корпоративных ассистентов, систем поиска по документам и других ИИ⁠-⁠приложений. Платформа управляет запуском инференса, доступом приложений к моделям и распределением ресурсов GPU. Команда Deckhouse отвечает за совместимость и поддержку компонентов решения.

Интеграция и сопровождение

Deckhouse берёт на себя интеграцию компонентов, проверку совместимости версий и техническую поддержку. Это снижает трудозатраты вашей команды на сборку и сопровождение платформы.

Повторные внедрения

Новые приложения могут использовать работающие сервисы, а отдельные установки — сохранённые конфигурации. Инженеры тратят меньше времени на подготовку инфраструктуры следующего проекта.

Эффективное использование GPU

Совместимые нагрузки могут делить ускоритель или использовать общий инференс. Это позволяет задействовать свободные мощности для новых задач, если имеющееся оборудование обеспечивает нужную производительность и изоляцию.

Основные возможности

Подбор конфигурации и запуск

Укажите модель и приоритет: время ответа, пропускная способность или их баланс. Платформа подберёт конфигурацию из доступных профилей с учётом ресурсов и политик, выделит GPU, доставит файлы модели и запустит сервис.

Доступ к общим сервисам

У каждого приложения — свой ключ доступа, список разрешённых моделей и лимиты. Шлюз направляет OpenAI⁠-⁠совместимые запросы к локальному инференсу или внешним провайдерам. Несколько приложений могут использовать один сервис, если подходят его настройки и производительность.

GPU для контейнеров и виртуальных машин

Контейнерам можно выделить долю GPU, целый ускоритель или сразу несколько, а ВМ — целую видеокарту напрямую. Режим зависит от доступной памяти и изоляции. Число реплик сервиса инференса меняется автоматически в заданных границах.

Повторное развёртывание и диагностика

Версию модели и параметры запуска можно сохранить для повторного развёртывания сервиса. Для проверки запуска и диагностики сбоев доступны статус сервиса, ошибки, число реплик и показатели GPU.

Сценарии использования

Запустить ИИ⁠-⁠ассистента или сервис поиска по документам на серверах компании
  • Команда разработки создаёт ИИ⁠-⁠приложение, подключает внутренние документы и проверяет качество ответов.
  • Deckhouse Platform предоставляет инференс и доступ к моделям, а также распределяет вычислительные ресурсы.
Выделить GPU для обучения и экспериментов
  • ML⁠-⁠инженеры продолжают работать в привычных инструментах.
  • Контейнеры получают выделенные или совместно используемые ресурсы GPU.
  • Целую видеокарту можно напрямую передать виртуальной машине и сохранить существующий стек ПО без переноса в контейнеры.

Архитектура решения

Deckhouse Platform Core обеспечивает работу кластера. Расширение «Управление GPU» подключает ускорители к нагрузкам, а «Сервисы ИИ⁠-⁠инференса» предоставляет каталог моделей, управляет запуском инференса и шлюзом доступа. Через него приложения обращаются к локальному инференсу или разрешённым внешним провайдерам.

Кому подойдёт

CIO

Обосновать закупки и спланировать бюджет на платформу, оборудование и сопровождение по мере роста числа ИИ⁠-⁠проектов.

CDTO

Запускать новые ИИ⁠-⁠проекты и распространять успешные приложения на подразделения, учитывая стоимость и сроки внедрения.

CTO вендоров ИИ⁠-⁠продуктов

Контролировать себестоимость внедрения, обновления и сопровождения ИИ⁠-⁠продукта у заказчиков.

Рекомендуемый состав решения

Решение состоит из базового продукта и всех нужных расширений для запуска и сопровождения ИИ⁠-⁠приложений на своих серверах. Вы можете получить новые возможности для решения своих задач, используя дополнительные расширения.

Deckhouse Platform Core

Базовая редакция Deckhouse Platform для запуска и эксплуатации контейнеров и виртуальных машин.

  • Управление GPU

    Повышайте полезную загрузку GPU⁠-⁠парка за счёт автоматического подбора конфигураций — от доли карты до нескольких GPU для одной задачи

  • Сервисы ИИ‑инференса

    Запускайте ИИ‑модели как готовые сервисы: Deckhouse автоматически подбирает конфигурацию, масштабируется под нагрузку и контролирует работу каждого из них

Подберём конфигурацию и рассчитаем затраты под вашу задачуПроведём пилот на выбранной модели и нагрузке, сравним затраты и производительность конфигураций и согласуем состав внедрения.
Получить консультацию

Эксперты, которые рядом

Команда Deckhouse

Наши эксперты обладают широким опытом работы в построение инфраструктуры под самые разные задачи для компаний любого масштаба.

Сеть партнёров

Порекомендуем партнёров, которые обладают необходимой экспертизой, подтверждённой сертификатом Deckhouse.

Техническая поддержка

Команда инженеров всегда готова прийти на помощь — устранить аварию или проконсультировать в нужный момент.

Часто задаваемые вопросы

Как формируется стоимость Deckhouse Platform для ИИ?

Цена зависит от состава решения, объёма приобретаемых прав и условий поддержки. При расчёте учитываем уже приобретённые права и согласованный объём работ по внедрению и сопровождению.

Нужен ли полный состав решения, если часть инфраструктуры уже работает?

Необязательно, рекомендуемый состав зависит от того, чего не хватает в инфраструктуре. Например, если в вашей ИТ⁠-⁠системе уже настроен инференс, «Управления GPU» может быть достаточно.

Перед заменой действующей ИИ⁠-⁠платформы сравним ограничения и затраты на сопровождение. Если вы уже используете Deckhouse Platform, проверим совместимость расширений и учтём приобретённые права.

Какие модели и GPU подойдут для работы в Deckhouse Platform?

Решение поддерживает ускорители NVIDIA и MetaX C500/C550. Для MetaX нужны выделенные узлы с программным обеспечением производителя. Совместимость модели, движка инференса и ускорителя необходимо проверять отдельно для каждой конфигурации. Например, способы разделения зависят от GPU, драйвера и версии поставки: MIG и MPS требуют совместимой конфигурации, а TimeSlicing не изолирует память.

Можно ли работать без интернета?

Да. Для работы внутри закрытой сети потребуется заранее подготовить образы, файлы моделей и зависимости. Локальный инференс не требует внешнего API. Если подключён внешний провайдер, интернет потребуется: запросы к нему выходят за пределы закрытой сети.

Входит ли в решение готовый ИИ⁠-⁠ассистент или MLOps⁠-⁠платформа?

Приложение разрабатывает ваша команда или поставляет партнёр; они же отвечают за подключение данных и качество ответов. На платформе можно размещать инструменты обучения и экспериментов, но полный MLOps⁠-⁠цикл в состав решения не входит.