Управление GPU
Повышайте полезную загрузку GPU-парка за счёт автоматического подбора конфигураций — от доли карты до нескольких GPU для одной задачи.
Под каждую задачу выбирается свой режим: целая карта, MIG, MPS, MPS внутри MIG или TimeSlicing. Небольшие сервисы больше не занимают всю GPU целиком, если им достаточно части ресурса.
Администратор задаёт классы по производителю, модели, объёму памяти и профилю. Приложение указывает класс и количество, а Deckhouse подбирает подходящий узел.
Если одной карты мало, механизм DRA найдёт узел с нужным набором свободных устройств и зарезервирует их вместе для одной задачи.
Система проверяет драйверы, среду запуска контейнеров и состояние GPU перед выдачей. В нагрузку попадают только исправные и полностью готовые к работе устройства.
Наглядные дашборды показывают температуру, питание и фактическую загрузку видеопамяти от уровня кластера до конкретного пода. Вы сразу видите, какие карты простаивают или выделены с избытком.
Больше не нужно собирать инструменты по частям. Deckhouse объединяет обнаружение устройств, их выдачу и мониторинг в одном интерфейсе для NVIDIA и MetaX.
Как Deckhouse управляет GPU
Агент на каждом узле проводит инвентаризацию: находит физические GPU и сохраняет модель, объём памяти, PCI‑адрес и состояние устройства. Адаптеры NVIDIA или MetaX подтверждают готовность устройств и доступные режимы разделения.
Администратор создает классы GPU, группируя их по производителю, модели, объёму памяти и профилю разделения. Приложение запрашивает нужный класс и количество мощностей. Если задаче требуется несколько устройств, механизм DRA резервирует весь набор на одном подходящем узле.
Контроль за состоянием ресурсов автоматизирован: к выдаче допускаются только готовые GPU, а уже занятые устройства не перенастраиваются. Данные о состоянии и фактической загрузке транслируются в Prometheus и Grafana.
Работа с расширением
Рекомендуем в составе готовых решений
Поможем повысить отдачу от вашего GPU-парка
Разберём ваши сценарии работы с ИИ и ML, настроим динамическое распределение ресурсов и поможем внедрить GPU-шеринг для максимальной загрузки оборудования.
Часто задаваемые вопросы
Расширение входит в состав редакции Deckhouse Platform Ultimate и доступно как дополнение к Deckhouse Platform Core.
В будущем расширение войдёт в состав редакции Deckhouse Platform Certified Pro и будет доступно как дополнение к Deckhouse Platform Certified Core.
Небольшим и нерегулярным нагрузкам не обязательно выделять целую карту. Расширение позволяет запросить подходящий класс и режим использования GPU, а Kubernetes DRA выбирает доступное устройство и готовит его для контейнера. MIG, MPS, MPS внутри MIG и TimeSlicing помогают размещать больше совместимых нагрузок на том же парке. Эффект виден по занятости и фактической загрузке в дашбордах.
Да. MIG создаёт изолированные профили вычислений и видеопамяти. MPS позволяет нескольким совместимым процессам одновременно использовать вычислительные ресурсы, в том числе внутри MIG. TimeSlicing даёт совместный доступ по времени без изоляции памяти. Для MetaX C500/C550 доступна динамическая sGPU.
Администратор создаёт класс с требованиями к производителю, модели, памяти и профилю. Приложение указывает имя класса и количество. Kubernetes выбирает узел, где доступен весь набор.
GPU Inventory показывает все устройства, их готовность и причины блокировки. Для NVIDIA дашборды дополнительно показывают загрузку, память, температуру, питание, NVLink и фактическое использование по Pod.
В режиме DRA поддерживаются NVIDIA и MetaX C500/C550. Для NVIDIA доступны целые и несколько GPU, MIG, TimeSlicing, MPS и MPS внутри MIG; для MetaX — целые и несколько GPU или динамическая sGPU. Для MetaX нужны выделенные узлы с вендорным ПО. Доступные режимы зависят от модели и версии драйвера.