Расширение

Управление GPU

Повышайте полезную загрузку GPU⁠-⁠парка за счёт автоматического подбора конфигураций — от доли карты до нескольких GPU для одной задачи.

Максимальная отдача от оборудования

Под каждую задачу выбирается свой режим: целая карта, MIG, MPS, MPS внутри MIG или TimeSlicing. Небольшие сервисы больше не занимают всю GPU целиком, если им достаточно части ресурса.

Гибкая конфигурация без привязки к железу

Администратор задаёт классы по производителю, модели, объёму памяти и профилю. Приложение указывает класс и количество, а Deckhouse подбирает подходящий узел.

Масштабирование для «тяжёлых» задач

Если одной карты мало, механизм DRA найдёт узел с нужным набором свободных устройств и зарезервирует их вместе для одной задачи.

Гарантия готовности ресурсов

Система проверяет драйверы, среду запуска контейнеров и состояние GPU перед выдачей. В нагрузку попадают только исправные и полностью готовые к работе устройства.

Измеримый эффект

Наглядные дашборды показывают температуру, питание и фактическую загрузку видеопамяти от уровня кластера до конкретного пода. Вы сразу видите, какие карты простаивают или выделены с избытком.

Единый стандарт управления

Больше не нужно собирать инструменты по частям. Deckhouse объединяет обнаружение устройств, их выдачу и мониторинг в одном интерфейсе для NVIDIA и MetaX.

Как Deckhouse управляет GPU

Агент на каждом узле проводит инвентаризацию: находит физические GPU и сохраняет модель, объём памяти, PCI‑адрес и состояние устройства. Адаптеры NVIDIA или MetaX подтверждают готовность устройств и доступные режимы разделения.

Администратор создает классы GPU, группируя их по производителю, модели, объёму памяти и профилю разделения. Приложение запрашивает нужный класс и количество мощностей. Если задаче требуется несколько устройств, механизм DRA резервирует весь набор на одном подходящем узле.

Контроль за состоянием ресурсов автоматизирован: к выдаче допускаются только готовые GPU, а уже занятые устройства не перенастраиваются. Данные о состоянии и фактической загрузке транслируются в Prometheus и Grafana.

Работа с расширением

GPU⁠-⁠устройства автоматически обнаруживаются на хостах и добавляются в инвентарь. Производится их конфигурация и проверка, публикуется статус готовности с описанием причин блокировки, если они есть.
Задайте классы устройств, указав производителя, модель, объём памяти, профиль разделения или любую их комбинацию. Приложения используют стабильное имя класса, даже если состав GPU⁠-⁠парка меняется.
Укажите в манифесте приложения класс и количество — от одного профиля до нескольких карт. DRA найдёт узел, где доступен весь набор, и подключит устройства к контейнеру.
Используйте технологии разделения: для NVIDIA доступны целая карта, MIG, MPS, MPS внутри MIG и TimeSlicing. Для MetaX — целая карта или динамическая sGPU.
Отслеживайте состояние ресурсов на дашбордах: инвентарь, занятость, фактическую загрузку и видеопамять от кластера до Pod, а также температуру и питание.

Поможем повысить отдачу от вашего GPU⁠-⁠парка

Разберём ваши сценарии работы с ИИ и ML, настроим динамическое распределение ресурсов и поможем внедрить GPU⁠-⁠шеринг для максимальной загрузки оборудования.

Часто задаваемые вопросы

В каких редакциях платформы доступно «Управление GPU»?

Расширение входит в состав редакции Deckhouse Platform Ultimate и доступно как дополнение к Deckhouse Platform Core.

В будущем расширение войдёт в состав редакции Deckhouse Platform Certified Pro и будет доступно как дополнение к Deckhouse Platform Certified Core.

Как повысить загрузку GPU в Kubernetes?

Небольшим и нерегулярным нагрузкам не обязательно выделять целую карту. Расширение позволяет запросить подходящий класс и режим использования GPU, а Kubernetes DRA выбирает доступное устройство и готовит его для контейнера. MIG, MPS, MPS внутри MIG и TimeSlicing помогают размещать больше совместимых нагрузок на том же парке. Эффект виден по занятости и фактической загрузке в дашбордах.

Можно ли разделить одну видеокарту между несколькими приложениями?

Да. MIG создаёт изолированные профили вычислений и видеопамяти. MPS позволяет нескольким совместимым процессам одновременно использовать вычислительные ресурсы, в том числе внутри MIG. TimeSlicing даёт совместный доступ по времени без изоляции памяти. Для MetaX C500/C550 доступна динамическая sGPU.

Как запросить определённую модель или несколько GPU?

Администратор создаёт класс с требованиями к производителю, модели, памяти и профилю. Приложение указывает имя класса и количество. Kubernetes выбирает узел, где доступен весь набор.

Как понять, какие GPU простаивают или требуют внимания?

GPU Inventory показывает все устройства, их готовность и причины блокировки. Для NVIDIA дашборды дополнительно показывают загрузку, память, температуру, питание, NVLink и фактическое использование по Pod.

Какие GPU и режимы разделения поддерживаются?

В режиме DRA поддерживаются NVIDIA и MetaX C500/C550. Для NVIDIA доступны целые и несколько GPU, MIG, TimeSlicing, MPS и MPS внутри MIG; для MetaX — целые и несколько GPU или динамическая sGPU. Для MetaX нужны выделенные узлы с вендорным ПО. Доступные режимы зависят от модели и версии драйвера.

Мы используем файлы cookie, чтобы сделать работу с сайтом удобнее.
Подробнее — в политике обработки персональных данных и политике использования файлов cookie.