Стадия жизненного цикла модуля: Общедоступная версия
У модуля есть требования для установки
v1.1.6
Изменения
- Агент сбора метрик (opagent) теперь запускается только на узлах, где работают отслеживаемые сервисы, а не на всех узлах кластера.
v1.1.5
Изменения
- CA-сертификат admission-вебхука модуля теперь хранится в отдельном Secret и больше не перевыпускается после рестарта Deckhouse. Раньше после рестарта в конфигурации вебхука мог оказаться CA, не совпадающий с сертификатом самого вебхука, и создание или изменение ресурсов модуля не работало до перевыпуска сертификата.
Исправления
- Метрики без лейбла
namespace(node-exporter, kubelet и другие метрики уровня узла) больше не скрываются из API лейблов для пользователей с доступом к метрикам всего кластера. Автодополнение метрик в Grafana и переменные дашбордов видаmetrics(node_.*)иlabel_values(nodename)теперь показывают их так же, как результаты запросов. - Пользователи теперь могут создавать ресурсы ClusterObservabilityPropagatedMetricsRulesGroup — общедоступные группы правил для метрик, распространяемые на все проекты. Раньше их создание отклонялось.
- Исправлено отсутствие у Grafana права на чтение чувствительных полей ресурсов GrafanaAdditionalDatasource.
- Внешние ссылки в текстовых панелях дашбордов теперь открываются в новой вкладке браузера, а не вместо встроенной Grafana.
Безопасность
- Исправлены различные уязвимости.
v1.1.4
Изменения
- Системные метрики компонентов модуля теперь содержат лейбл
d8_source="dkp". Это исключает появление дублирующихся временных рядов и ошибок при вычислении правил, если пользовательский экспортер отдаёт метрики с теми же именами. - Неймспейс модуля теперь проверяется по профилю Pod Security Standards
restricted. Нарушения выводятся только как предупреждения и не блокируют запуск нагрузки. Минимальная версия Deckhouse для модуля повышена до 1.74.
Улучшения
- В документацию по мониторингу сервисов добавлены инструкции по настройке подключения к PostgreSQL, включая резервирование подключений для роли мониторинга в PostgreSQL 16 и новее.
Исправления
- Убрано значение по умолчанию для интервала вычисления в propagated-группах правил для метрик.
- Добавлены RBAC v1 разрешения для пользователей на ресурсы ObservabilityLogsRulesGroup и ClusterObservabilityLogsRulesGroup.
- Исправлена ошибка, из-за которой агент сбора метрик в кластере запрашивал обновления supervisor-а.
Безопасность
- Учётные данные каналов уведомлений теперь маскируются в ответах API. Для их чтения требуется отдельное право, поэтому пользователи, которым разрешён только просмотр канала, больше не видят его учётные данные.
- Адреса в каналах уведомлений теперь проверяются: канал может указывать только на адрес, который может быть получателем уведомлений. Адреса внутри кластера и в частной сети остаются разрешёнными.
- В секции
httpConfigканалов уведомлений поля, ссылающиеся на файл внутри контейнера, объявлены устаревшими и больше не применяются:basicAuth.passwordFile,authorization.credentialsFile,oauth2.clientSecretFile,caFile,certFileиkeyFileв обеих секцияхtlsConfig, а такжеfilesвhttpHeaders. Для передачи содержимого заголовков используйтеvaluesиsecrets. Также перестало применяться полеfollowRedirects— переходы по редиректам не выполняются. Существующие ресурсы остаются валидными, но значения этих полей игнорируются, поэтому канал, который на них опирался, нужно перенастроить. - Усилена проверка параметров конфигурации модуля.
- Исправлены различные уязвимости.
v1.1.0
Новые возможности
- Добавлена поддержка high-availability режима для observability-controller
- Добавлен сервис Logs ruler, позволяющий собирать метрики Prometheus на основе логов. Пользователь может добавить правила с logQL выражениями, результаты вычисления которых сохраняются в метриках Prometheus
- Добавлена фильтрация алертов по статусу в alert-kube-api.
- Добавлена поддержка конфигурации scrape interval в opagent.
Изменения
- Добавлен лейбл source=“deckhouse” ко всем системным метрикам.
- Добавлена информация по rolebinding и CAR в документацию модуля
- Конфигурация Opagent-а изменена так, чтобы по умолчанию собирать метрики только с управляемых сервисов
Исправления
- Исправленны сломанные ссылки в документации модуля
- Исправлен баг, приводивший к тому, что новые неймспейсы появлялись в Обзоре данных и Дашбордах с задержкой.
- Исправлена ошибка в документации модуля, где указывалось, что сервис lightweight logs по умолчанию выключен
- Исправлена ошибка в дашбордах, приводившая к некорректному отображению метрик в случае рестарта opagent-а. Дашборды отображали метрики только одного инстанса opagent-а и в случае его рестарта метрики нового opagent-а не показывались.
- Исправлена ошибка, не позволявшая alertmanager-у корректно запускаться при пустом publicDomainTemplate
- Исправлена ошибка, приводившая к остановке сборки метрик opagent-ом в случае рестарта containerd.
v1.0.8
Исправления
- Исправлена ошибка, из-за которой кластерные отключения уведомлений могли некорректно работать после рестарта Алертменеджера.
v1.0.7
Изменения
- У алерта PrometheusUnavailable изменен приоритет на S3 и задержка срабатывания алерта увеличина до 5 минут.
v1.0.6
Безопасность
- Исправлены различные уязвимости в сторонних библиотеках
Исправления
- Исправлено расположение компонентов на k8s кластерах только с мастер-узлами.
v1.0.5
Исправления
- Порядок деплоя ресурсов модуля теперь детерминирован и работает корректно с nelm
v1.0.4
Изменения
- Модуль Observability теперь полностью совместим с Deckhouse CSE
v1.0.3
Изменения
- Opagent по умолчанию собирает метрики только управляемых сервисов
Исправления ошибок
- Исправлена ошибка, из-за которой opagent прекращал собирать метрики после рестарта containerd
v1.0.2
Изменения
- Исправлены уязвимости, связанные с CVE-2026-40181 в react-router 6.30.2
v1.0.1
Изменения
- Для сборки модуля теперь используется образ container-base и пакетный менеджер
pm
v1.0.0
Изменения
- Стадия жизненного цикла модуля Observability изменена с Preview на General Availability
Улучшения
- Доработана русскоязычная документация кастомных ресурсов модуля, удалены устаревшие ресурсы.
- В протокол синхронизации компонентов алертменеджера добавлено шифрование TCP/TLS.
Новые возможности
- Добавлен инструмент легковесных логов. Он предоставляет доступ к логам всех подов в Обзоре данных проекта. При выборе источника данных lightweight-logs в Обзоре данных, можно просматривать логи всех подов, фильтровать их по лейблам и аннотациям подов, выбирать временной интервал и т.д.
- Добавлен мониторинг управляемых сервисов. В данный момент поддерживаются управляемые сервисы PostgreSQL и Memcached. При запуске управляемых сервисов данных типов в Обзоре данных добавлена возможность выбрать дашборды для их мониторинга, так же добавлен ряд триггеров алертов для данных сервисов.
- Добавлена возможность добавлять дополнительные лейблы к триггерам алертов, поставляемых вместе с модулями Deckhouse Kubernetes Platform.
- В каналы уведомлений об алертах добавлена поддержка eXpress Messenger.
- В каналы уведомлений webhook добавлена возможность конфигурировать параметры аутентификации.
- Добавлена возможность включать / выключать аннотации Polk в уведомлениях об алертах.
Исправления ошибок
- В документации модуля исправлен путь для внешней записи метрик
- Исправлена ошибка, из-за которой иногда тестовые алерты Upmeter-а попадали в общий список алертов.
- Добавлено удаление финалайзеров модуля Observability в случае его отключения.
- Из групп рулов удален дефолтный интервал вычисления триггера (ранее был установлен равным 1 минуте).
- В opagent-е модуля включена конфигурация для корректной загрузки токена сервис аккаунта.
- В Алертменеджер добавлена возможность делить большие группы алертов на меньшие при отправке их в Telegram и Slack.
v0.9.8
Исправления ошибок
- Исправлены шаблоны модуля, проверка наличия CRD из др. модулей заменена на проверку, включены ли эти модули.
v0.9.7
Исправления ошибок
- Исправлена ошибка, приводившая к невозможности внешней записи метрик проекта с помощью RemoteWrite протокола
v0.9.6
Исправления
- Исправления следующих уязвимостей CVE: CVE-2026-42151, CVE-2026-42154, CVE-2026-44903, CVE-2025-15558, CVE-2025-47914, CVE-2025-58181, CVE-2026-32952, stdlib (Go 1.25.10) и уязвимостей базовых образов. Дополнительно ряд уязвимостей CVE в
github.com/prometheus/prometheus,github.com/grafana/tempo,github.com/getkin/kin-openapi,github.com/grafana/grafana-plugin-sdk-goиgithub.com/grafana/grafanaразмеченных VEX разметкой как безопасные.
v0.9.5
Исправления ошибок
- Удалено дефолтное значение интервала в спецификации триггеров и метрик
v0.9.4
Исправления ошибок
- В конфигурации daemonset-а opagent-а включен рефреш токена ServiceAccount-а. Выклченный рефреш токена приводил к алертам D8KubernetesStaleTokensDetected.
v0.9.3
Исправления ошибок
- Исправлено некорректное определение Prometheus-а когда глобальный HA режим отключен
v0.9.2
Исправления ошибок
- Исправлены ссылки на панель дашборда в консоли
v0.9.1
Исправления ошибок
- Устранены уязвимости, связанные с CVE
v0.9.0
Новые возможности
- Добавлена поддержка мультитенантности логов. Теперь в обзоре данных показываются только логи текущего проекта / кластера. Таким образом добавлена возможность управлять доступом пользователей к логам конкретных проектов.
Изменения
- Режим High-availability улучшен. Теперь данные об активных и завершенных алертах сохраняются при роллауте сервисов модуля или апдейте модуля.
- Валидация уникальности UID дашборда заменена алертом, который оповещает о конфликтах UID-ов.
- Улучшена авторизация сервисов модуля.
- Документация модуля Observability переработана и улучшена
Исправления ошибок
- Исправлена валидация имен для лейблов, аннотаций и метрик в триггерах и производных метриках для корректного отображения недопустимых имен во время создания или редактирования групп рулов
- Исправлена ошибка, из-за которой не отображались алерты и правила в разделе Состояние мониторинга в проектах.
- Исправлены ошибки, вызывавшие 401 статусы ответов при отображении дашбордов с большим количеством панелей или remote write запросов.
v0.8.2
Исправления ошибок
- Исправлена ошибка конфигурации Email-канала уведомлений, из-за которой игнорировалась опция “Необходим TLS”.
v0.8.1
Исправления ошибок
- Исправления следующих уязвимостей: CVE (CVE-2026-33186, CVE-2026-24051, CVE-2025-15558, CVE-2026-25679, CVE-2025-68470)
v0.8.0
Новые возможности
- Высокая доступность алертинга — если платформа Deckhouse Kubernetes Platform запущена в high availability режиме, то алертинг Observability так же работает в режиме HA для повышения доступности.
- Улучшенный мониторинг доступности Prometheus — алерты DeadMansSwitch и PrometheusUnavailable обновлены для более надёжного контроля доступности Prometheus.
- Общедоступные политики уведомлений — можно настроить доставку уведомлений об алертах по каждому проекту с помощью общедоступных политик (ClusterObservabilityPropagatedNotificationPolicy) и каналов уведомлений (ClusterObservabilityPropagatedNotificationChannel).
Исправления ошибок
- Исправлено пустое состояние группы правил в группах правил метрик из-за конфликтов версий ресурсов.
- Исправлена ошибка включения модуля при пустом глобальном параметре
publicDomainTemplate. - Исправлен некорректный результат «No data» для PromQL-запросов с негативным regexp-матчером (
!~). - Исправлено некорректное отображение графиков в Grafana при нескольких условиях по одному и тому же label в PromQL-запросе.
- Исправлены ошибки при использовании custom resource группы правил без правил.
- В выражениях кластерных правил теперь поддерживается пустой namespace для выбора метрик.
Улучшения
- Правила Prometheus модулей Deckhouse теперь хранятся в namespace
d8-observability. - Алерты из правил Prometheus без указания scope кластера/namespace теперь отображаются в списке алертов соответствующего namespace, а не в системных. Затрагиваются только правила, не заданные через ClusterObservabilityMetricsRulesGroup или ObservabilityMetricsRulesGroup.
- Уточнён раздел FAQ по настройке доступа внешней Grafana к метрикам.
v0.7.23
Исправления
- Исправлена ошибка, препятствовавшая корректному подключению к некоторым дополнительным источникам данных Grafana (в т.ч. ClickHouse).
- Исправлены разрешения пользовательских ролей.
v0.7.21
Изменения
- Включён Kubernetes API для получения данных об активных и завершённых алертах (используется Deckhouse Web UI и при получении списка алертов через kubectl). Ранее он был отключён в версии 0.7.15 для инсталляций на Kubernetes 1.32 из‑за регрессии.
v0.7.20
Изменения
- Расширен Prometheus rules API
v0.7.19
Изменения
- Observability webhook перемещён на узлы control plane. Компонент теперь считается критичным для стабильности кластера.
v0.7.18
Изменения
- Убрали служебные лейблы с производных метрик.
v0.7.17
Изменения
- Временно отключен энфорсинг неймспейсов кластерных рулов
v0.7.16
Исправления
- Исправлена ошибка, препятствовавшая корректному удалению неймспейса.
v0.7.15
Изменения
- Для версии kubernetes 1.32 выключен apiservice v1alpha1.alerts.observability.deckhouse.io
v0.7.14
Исправления ошибок
- Исправлена ошибка, вызывавшая сбой загрузки конфигурации тенанта алертменеджера
Изменения
- PrometheusRules теперь создаются в неймспейсе d8-observability. Создание PrometheusRules в неймспейсе d8-monitoring приводило к срабатыванию алерта D8CustomPrometheusRuleFoundInCluster.
v0.7.0
Новые возможности
Алерты, триггеры, производные метрики: системные и namespace-уровня
В системе появились новые типы объектов для мониторинга: как для всего кластера, так и для отдельных namespace.
- ClusterObservabilityMetricRules — общекластерные правила, включающие и триггеры (Alerting Rules), и производные метрики (Recording Rules).
- ClusterObservabilityAlerts — системные алерты, автоматически сигнализирующие о проблемах в инфраструктуре в системных неймспейсах.
- ObservabilityMetricRules — правила для конкретного namespace, которые также включают триггеры и производные метрики, но применяются только к данным внутри своего пространства имён.
- ObservabilityAlerts — алерты, формируемые на основе ObservabilityMetricRules, настроенных для отдельных namespace; позволяют каждой команде видеть только инциденты, относящиеся к их сервисам, без лишнего шума от других команд.
Управление триггерами и метриками
Интерфейс для работы с триггерами и производными метриками полностью обновлён: теперь настраивать условия алертов и создавать собственные метрики стало проще и быстрее. Все действия доступны из одного окна, что сокращает время настройки и снижает порог входа при работе с правилами мониторинга.
Просмотр алертов
Переработан интерфейс просмотра алертов: они разделены по уровню критичности, а при открытии сразу отображается график метрики, по которой сработал триггер.
Настройка уведомлений
Настройки уведомлений теперь можно изменять прямо в интерфейсе, без необходимости редактировать YAML-файлы вручную.
- Канал уведомлений — куда отправляется уведомление (Email, Webhook, Slack, Telegram).
- Политика уведомлений — какие алерты и при каких условиях отправляются в выбранный канал.
Можно точно определить, кому, при каких условиях и куда отправлять уведомления. В результате каждый получает только релевантные сообщения по своей зоне ответственности — лишний шум исключён. Все параметры задаются через графический интерфейс, а изменения сохраняются в Custom Resources, которые затем можно перенести в git.
Отключение уведомлений: контроль над потоком сообщений
В любой момент можно временно отключить отправку уведомлений для конкретного алерта — например, если команда уже работает над решением проблемы. Повторные уведомления по этому событию не будут отвлекать, при этом вся информация сохраняется в системе.
Улучшения
Редизайн просмотра дашборда
- Расширенный экран: дашборды занимают всю ширину, боковое меню скрыто по умолчанию — больше данных видно, работать удобнее.
- Удобная навигация по дашбордам: реализован быстрый поиск по дашбордам с поддержкой горячих клавиш и навигацией с клавиатуры.
v0.6.0
Новые возможности
- Добавлена поддержка тёмной темы для компонентов визуализации дашборда. Основной интерфейс уже поддерживал темную тему, теперь тёмная тема полностью поддерживается и для дашбордов и графиков.
- Добавлен новый режим киоска для дашбордов. При его активации все элементы навигации и меню скрываются, что позволяет отображать дашборды в полноэкранном режиме — это удобно для телевизоров и настенных мониторов.
Безопасность
- Устранены уязвимости, связанные с CVE (CVE-2025-30153, CVE-2025-47912, CVE-2025-58183, CVE-2025-58185, CVE-2025-58186, CVE-2025-58187, CVE-2025-58188, CVE-2025-58189, CVE-2025-61723, CVE-2025-61724, CVE-2025-61725)
v0.5.6
Изменения
- Изменен статус модуля с experimental на preview.
Исправления ошибок
- Исправлена ошибка, связанная с кэшированием токенов авторизации, из-за которой некорректно срабатывал встроенный алерт: D8KubernetesStaleTokensDetected.
v0.5.5
Безопасность
- Устранены уязвимости, связанные с CVE
v0.5.4
Изменения
- Подготовка к переходу на container v2 — в образы добавлены точки монтирования, текущее использование не изменилось.
v0.5.3
Исправления ошибок
- Исправлена некорректная обработка ссылок в дашбордах — ранее из-за ошибки некоторые ссылки в дашбордах могли отображаться неверно.
v0.5.2
Исправления ошибок
- Исправлена ошибка, связанная с кэшированием токенов авторизации, из-за которой некорректно срабатывал встроенный алерт: D8KubernetesStaleTokensDetected.
v0.5.1
Исправления ошибок
- Исправлена ошибка, из-за которой некорректно работал выход из “Edit Mode” дашборда.
Новые возможности
- Добавлена возможность записи метрик в Prometheus кластера протоколу Prometheus Remote Write