Стадия жизненного цикла модуля: General Availability
У модуля есть требования для установки

Справочник по всем метрикам, которые собирает и отправляет агент Deckhouse Observability Platform (opAgent). Метрики сгруппированы по смыслу: базовые системные, диски, сеть, оборудование, процессы и контейнеры, виртуализация, СУБД, очереди, веб-серверы, JVM, почта, безопасность, пользовательские и служебные.

Как читать этот справочник

Имена метрик

Внутри агента имена метрик используют точки (cpu.usage.user). При отправке в хранилище имена преобразуются в Prometheus-совместимую форму:

  • точка . заменяется на __ (двойное подчёркивание): cpu.usage.usercpu__usage__user;
  • дефис - заменяется на ____ (четыре подчёркивания);
  • к имени, начинающемуся с цифры, добавляется префикс ___: 1min___1min.

В этом документе все имена приведены в том виде, в котором они хранятся и запрашиваются (то есть с __).

Общие лейблы

Каждая метрика агента автоматически получает лейблы:

Лейбл Значение
job, okagent_plugin имя плагина, собравшего метрику (cpu, postgresql, nginx, …)
conf, okagent_plugin_instance экземпляр плагина: путь к конфигу, адрес сервиса или контейнер
instance hostname сервера, на котором работает агент

Для метрик из контейнеров Kubernetes дополнительно добавляются k8s_namespace, k8s_pod, k8s_container, k8s_namespace_pod. Пользовательские лейблы из секции labels: конфига плагина добавляются ко всем его метрикам.

В таблицах ниже перечислены только собственные лейблы метрик — общие не повторяются.

Типы метрик

Тип Описание
gauge мгновенное значение (объём памяти, число соединений)
counter монотонно растущий счётчик (байты с момента старта); скорость считается функцией rate()
rate скорость, уже посчитанная агентом за интервал сбора (~60 секунд); rate() применять не нужно
text текстовое значение (версия, MAC-адрес). Хранится как серия со значением лейбла value=<текст> и лейблом metric_type="text"
status статусная метрика: значение 1 и value="empty" — всё хорошо; значение 0 и value=<текст ошибки> — проблема

Статус интеграций

Все автообнаруживаемые интеграции (PostgreSQL, MySQL, Redis, …) публикуют статусную метрику status или plugin__status: пустой текст — сбор работает, текст с ошибкой — что мешает сбору (нет прав, недоступен порт и т.п.).

Базовые системные метрики

CPU (плагин cpu)

Собирается автоматически на каждом сервере.

Метрика Лейблы Тип Описание
cpu__logical_cores gauge Число логических ядер
cpu__physical_sockets gauge Число физических CPU-сокетов
cpu__physical_cores gauge Суммарное число физических ядер
cpu__usage__user rate Доля времени CPU в user mode, %
cpu__usage__system rate Доля времени CPU в system mode, %
cpu__usage__nice rate Доля времени CPU с изменённым приоритетом (nice), %
cpu__usage__iowait rate Доля времени ожидания дискового ввода-вывода, %
cpu__usage__irq rate Доля времени обработки аппаратных прерываний, %
cpu__usage__softirq rate Доля времени обработки программных прерываний, %
cpu__usage__steal rate Доля времени, «украденного» гипервизором, %
user, system, nice, idle, iowait, irq, softirq, steal counter Накопленное время CPU по режимам, секунды (legacy-имена)
cpu__frequency__mhz core gauge Текущая частота ядра, МГц
cpu__governor core, governor gauge Признак (=1) активного scaling governor ядра (только Linux)
cpu_flags model_name, flag gauge Признак (=1) наличия CPU-флага (avx, sse4 и т.п.)
cpu__thermal_throttle__core_throttle_count cpu counter Число событий thermal throttling ядра (только Linux)
cpu__thermal_throttle__package_throttle_count cpu counter Число событий thermal throttling пакета CPU (только Linux)

Память и swap (плагин memory)

Метрика Лейблы Тип Описание
memory__total gauge Объём RAM, байты
memory__available gauge Доступная память (с учётом реклейма кэшей), байты
memory__usage__used gauge Используемая память (total − free − buffers − cached), байты
memory__usage__free gauge Свободная память, байты
memory__usage__buffers gauge Память в buffers, байты
memory__usage__cached gauge Память в page cache, байты
total, available, free, buffers, cached gauge Те же значения (legacy-имена)
memory__errors type = correctable | uncorrectable counter Ошибки памяти ECC из EDAC (только Linux, при наличии /sys/devices/system/edac)
memory__numa__allocated node, allocation = local_node | other_node | interleaved counter Аллокации страниц по NUMA-нодам (только при ≥2 нодах)
swap__total gauge Размер swap, байты
swap__space__free gauge Свободный swap, байты
swap__space__used gauge Занятый swap, байты
swap__io__in rate Скорость подкачки страниц в память, страниц/с
swap__io__out rate Скорость выгрузки страниц в swap, страниц/с
swap_total, swap_free gauge Размер и свободный swap (legacy-имена)
swap_in, swap_out counter Накопленные счётчики swap-страниц (legacy-имена)

Load average (плагин load_average)

Метрика Лейблы Тип Описание
load_average__1min gauge Средняя загрузка за 1 минуту
load_average__5min gauge Средняя загрузка за 5 минут
load_average__15min gauge Средняя загрузка за 15 минут
___1min, ___5min, ___15min gauge Те же значения (legacy-имена)

Информация об ОС (плагин uname)

Метрика Лейблы Тип Описание
uname os, machine, distrib, version, kernel, gather_tool gauge Признак (=1) с метаданными ОС: дистрибутив, версия, ядро, архитектура
host__uptime gauge Аптайм сервера, секунды
os, machine, distrib, version, kernel text Отдельные текстовые метрики с теми же значениями
uname_gather_error gauge =1, если не удалось определить дистрибутив

Время и NTP (плагин time)

Метрика Лейблы Тип Описание
time__ntp__status status Статус опроса NTP: пусто — ОК, текст — ошибка (серверы не найдены, таймаут)
time__current_offset, time__offset__ntp gauge Смещение локальных часов относительно NTP, секунды (может быть отрицательным)

NTP-серверы берутся из /etc/ntp.conf, при отсутствии — pool.ntp.org.

Идентификация хоста (плагины metadata, machine_identity)

Метрика Лейблы Тип Описание
machine_identity machine_id, source = dmi_uuid | dmi_serial | machine_id gauge Признак (=1) со стабильным идентификатором машины (DMI UUID, серийный номер или /etc/machine-id)
local_metadata__host__hostname_status status Отслеживание смены hostname: текст при изменении
local_metadata__host__group text Группа хоста из локального конфига агента (если задана)
local_metadata__host__description text Описание хоста из локального конфига (если задано)

Диски и хранилище

Файловые системы (плагин disk)

Для каждого смонтированного раздела; лейбл mount_point.

Метрика Лейблы Тип Описание
bytes_total mount_point gauge Общий размер файловой системы, байты
bytes_used, disk__partition__bytes_used mount_point gauge Занято, байты
disk__partition__bytes_available, disk__partition__space__available mount_point gauge Доступно пользователю, байты
disk__partition__bytes_reserved, disk__partition__space__reserved mount_point gauge Зарезервировано для root, байты
disk__partition__space__used mount_point gauge Занято, байты
inodes_total mount_point gauge Всего inode
inodes_used, disk__partition__inodes__used mount_point gauge Занято inode
disk__partition__inodes__free mount_point gauge Свободно inode
disk__partition__read_write mount_point gauge 1 — раздел смонтирован rw, 0 — ro
fs, disk__partition__fs mount_point text Тип файловой системы (ext4, xfs, …)
device, disk__partition__device mount_point text Блочное устройство раздела
mount_options, disk__partition__mount_options mount_point text Опции монтирования
disk__fs__errors device, fs="ext4" counter Счётчик ошибок ext4 из /sys/fs/ext4/*/errors_count (только Linux)

Дисковый ввод-вывод (плагин disk)

Скорости считаются агентом за интервал сбора.

Метрика Лейблы Тип Описание
disk__device__ops__read device, pci_bdf rate Операций чтения в секунду на блочном устройстве
disk__device__ops__write device, pci_bdf rate Операций записи в секунду
disk__device__bytes__read device, pci_bdf rate Прочитано байт/с
disk__device__bytes__write device, pci_bdf rate Записано байт/с
disk__device__io_time__read device, pci_bdf rate Время чтения, мс на секунду
disk__device__io_time__write device, pci_bdf rate Время записи, мс на секунду
disk__device__io_time__total device, pci_bdf rate Полное время I/O, мс на секунду (утилизация)
disk__partition__ops__read / __write mount_point rate Операций чтения/записи в секунду по разделу (включая ZFS-датасеты)
disk__partition__bytes__read / __write mount_point rate Байт/с чтения/записи по разделу

SMART (плагин disk)

Диагностика здоровья дисков. ATA-атрибуты читаются напрямую (SG_IO), NVMe — через ioctl, SCSI/SAS — через smartctl. Все метрики имеют лейблы device (например /dev/sda) и pci_bdf.

Метрика Тип Описание
disk_smart_has_smartctl gauge 1 — утилита smartctl установлена на хосте
disk_smart_device_model text Модель диска (ATA IDENTIFY)

ATA-атрибуты — семейство disk_smart_<attr>_value (нормализованное значение 0–255), disk_smart_<attr>_raw (сырое значение, где определён парсер), disk_smart_<attr>_threshold (порог отказа). Поддерживаемые <attr>:

<attr> (SMART ID) Описание
raw_read_error_rate (1) Ошибки чтения с поверхности
reallocated_sectors_ct (5) Переназначенные секторы (>0 — деградация)
power_on_hours (9) Часы наработки
spin_retry_count (10) Повторные попытки раскрутки шпинделя
power_cycle_count (12) Циклы включения питания
wear_leveling_count (177) Износ SSD Samsung (value = остаток ресурса, %)
program_fail_cnt_total (181) / erase_fail_cnt_total (182) Ошибки программирования/стирания NAND
end_to_end_error (184) Ошибки сквозного контроля целостности
reported_uncorrect (187) Неисправимые ошибки
command_timeout (188) Таймауты команд
temperature_celsius (194) Температура, °C (raw)
hardware_ecc_recovered (195) Исправленные ECC-ошибки
reallocated_event_count (196) События переназначения
offline_uncorrectable (198) Неисправимые секторы offline-проверки
udma_crc_error_count (199) CRC-ошибки интерфейса (кабель)
percent_lifetime_remain (202) / ssd_life_left (231) / media_wearout_indicator (233) Остаток ресурса SSD, %
total_lbas_written (241) / total_lbas_read (242) Всего записано/прочитано секторов

NVMe — все gauge:

Метрика Описание
disk_smart_nvme_available_spare Остаток резервных блоков, %
disk_smart_nvme_available_spare_threshold Порог предупреждения по резерву, %
disk_smart_nvme_percentage_used Израсходованный ресурс, % (0–255, >100 — сверх номинала)
disk_smart_nvme_temperature_celsius Температура контроллера, °C
disk_smart_nvme_media_errors Неисправимые ошибки носителя
disk_smart_nvme_power_on_hours Часы наработки
disk_smart_nvme_unsafe_shutdowns Небезопасные отключения питания
disk_smart_nvme_power_cycles Циклы питания
disk_smart_nvme_data_units_read / _written Прочитано/записано (1 unit = 500 КиБ)
disk_smart_nvme_host_read_commands / _write_commands Команды чтения/записи от хоста
disk_smart_nvme_critical_warning Сырой байт критических предупреждений (0 — норма)
disk_smart_nvme_critical_warning_spare_below 1 — резерв исчерпан
disk_smart_nvme_critical_warning_temp_exceeded 1 — перегрев
disk_smart_nvme_critical_warning_reliability_degraded 1 — деградация надёжности
disk_smart_nvme_critical_warning_read_only 1 — диск перешёл в read-only
disk_smart_nvme_critical_warning_backup_failed 1 — отказ резервного питания

SCSI/SAS (через smartctl) — все gauge:

Метрика Описание
disk_smart_scsi_temperature_celsius Температура, °C
disk_smart_scsi_grown_defects Приобретённые дефекты (grown defect list)
disk_smart_scsi_non_medium_errors Ошибки, не связанные с носителем
disk_smart_scsi_read_uncorrected / _write_uncorrected / _verify_uncorrected Неисправленные ошибки чтения/записи/верификации
disk_smart_scsi_info_exceptions 1 — SMART-статус «не пройден»

RAID (плагин raid)

Аппаратные контроллеры (MegaRAID/storcli, Adaptec/arcconf, HPE/ssacli) и программный Linux md. Только Linux. controller_id: megaraid:0, hpe:0, adaptec:1, soft-raid. Лейбл state_class — нормализованное состояние: healthy, rebuild, predictive, failed, offline, unknown (для массивов: optimal, degraded, offline, rebuilding, unknown).

Метрика Лейблы Тип Описание
raid_controller_info controller_id, model, serial, firmware, driver gauge =1; инвентарная запись контроллера
raid_controller_state controller_id, state_class, raw_state gauge =1; состояние контроллера
raid_controller_temperature_celsius controller_id gauge Температура контроллера, °C
raid_controller_bbu controller_id, state_class, raw_state gauge =1; состояние батареи (BBU)
raid_controller_bbu_health_percent controller_id gauge Здоровье батареи, 0–100 %
raid_controller_cachevault controller_id, state_class, raw_state gauge =1; состояние CacheVault (MegaRAID)
raid_array_info controller_id, array, raid_level, array_type gauge =1; инвентарная запись массива (VD/LD)
raid_array_state controller_id, array, state_class, raw_state gauge =1; состояние массива (и md-массивов)
raid_pd_state controller_id, slot_id, model, serial, wwn, media_type, state_class, raw_state gauge =1; состояние физического диска за контроллером
raid_md_degraded array, controller_id="soft-raid" gauge 1 — md-массив деградирован
raid_md_rebuild_pct array, controller_id="soft-raid" gauge Прогресс ребилда md, %
plugin__status controller status Пустой текст — сбор ОК; текст — контроллер обнаружен по PCI-драйверу, но CLI-утилита недоступна или парсинг упал

Сеть

Сетевые интерфейсы (плагин net)

Для каждого интерфейса, кроме veth*; лейбл interface.

Метрика Лейблы Тип Описание
net__interface__bytes__in / __out interface rate Байт/с принято/отправлено
net__interface__packets__in / __out interface rate Пакетов/с
net__interface__errors__in / __out interface rate Ошибок/с
net__interface__drops__in / __out interface rate Отброшенных пакетов/с
in_bytes, in_packets, in_errors, in_dropped, out_bytes, out_packets, out_errors, out_dropped interface counter Накопленные счётчики из /proc/net/dev (legacy-имена)
net__interface__status, status interface gauge 1 — интерфейс UP, 0 — DOWN
mtu interface gauge MTU интерфейса
hw_address interface text MAC-адрес
net__ip__status interface, ip, version = v4 | v6 gauge =1; признак наличия IP-адреса на интерфейсе
ipv4_addresses, ipv6_addresses interface text JSON-списки адресов интерфейса
net__conntrack__count gauge Текущее число записей conntrack (только Linux)
net__conntrack__max gauge Лимит таблицы conntrack

Сокеты и TCP (плагин netstat)

Только Linux; сбор в сетевом пространстве имён хоста.

Метрика Лейблы Тип Описание
netstat__protocol__packets__in / __out protocol = tcp | udp | icmp | ip counter Принятые/отправленные пакеты (сегменты, датаграммы) по протоколу
netstat__protocol__packets__errors protocol, error counter Ошибки протокола: для UDP — NoPorts, RcvbufErrors, SndbufErrors, InErrors; для TCP — OutRsts, InErrs; для IP — InHdrErrors, InAddrErrors, InUnknownProtos, InDiscards, OutNoRoutes, ReasmFails, FragFails
netstat__protocol__packets__retransmits protocol="tcp" counter TCP-ретрансмиты
netstat__listen__status listen_ip, listen_port gauge =1 для каждого слушающего порта (при >200 портов группируются в диапазоны)
netstat__listen__current_ack_backlog listen_ip, listen_port gauge Текущий backlog очереди accept
netstat__listen__max_ack_backlog listen_ip, listen_port gauge Максимальный backlog
netstat__connections__inbound__count listen_ip, listen_port, remote_ip, state gauge Число входящих TCP-соединений по состоянию (ESTABLISHED, TIME_WAIT, SYN_RECV, …)
netstat__connections__outbound__count remote_ip, state gauge Число исходящих соединений по состоянию
netstat__connections__inbound__with_read_queue / outbound… как у count gauge Соединения с непустой очередью чтения
netstat__connections__inbound__with_write_queue / outbound… как у count gauge Соединения с непустой очередью записи
netstat__connections__inbound__rtt / outbound… как у count + percentile="95" gauge 95-й перцентиль RTT соединений, секунды
okagent__netstat__listen__status status Текст too many listen ports при усечении списка портов

Нелокальные удалённые адреса агрегируются в remote_ip="~nonlocal".

SNMP-устройства (плагин netdev, по конфигу)

Опрос сетевого оборудования по SNMP v2c (IF-MIB). Настраивается YAML-файлом с host и community.

Метрика Лейблы Тип Описание
in_bytes / out_bytes interface, description counter Принято/отправлено байт на порту устройства
in_packets / out_packets interface, description counter Пакеты
speed interface, description gauge Скорость порта, байт/с

Оборудование и инвентаризация

Аппаратная инвентаризация (плагин cmdb)

Полная инвентаризация железа bare-metal-серверов: SMBIOS, sysfs, CLI RAID-утилиты. На виртуальных машинах плагин отключается. Все *_info-метрики — gauge со значением 1, идентификация — через лейблы (component_key, serial, model, manufacturer и др.). Рескан раз в 5 минут.

Метрика Тип Описание
cmdb_system_info gauge Система (SMBIOS Type 1): производитель, модель, серийный номер
cmdb_baseboard_info gauge Материнская плата (Type 2)
cmdb_bios_info gauge BIOS (Type 0)
cmdb_chassis_info gauge Шасси (Type 3)
cmdb_cpu_socket_info gauge Одна серия на CPU-сокет
cmdb_cpu_sockets_total / _populated gauge Всего/занято CPU-сокетов
cmdb_memory_slot_info gauge Одна серия на DIMM-слот
cmdb_memory_slots_total / _populated gauge Всего/занято слотов памяти
cmdb_memory_total_bytes gauge Установлено памяти, байты
cmdb_memory_max_capacity_bytes gauge Максимальная ёмкость по SMBIOS
cmdb_storage_block_device_info gauge Одна серия на блочное устройство (/sys/class/block: диски, разделы, LVM, md); лейбл type = physical_disk | raid_volume | partition | lvm | mdraid | unknown
cmdb_storage_block_device_capacity_bytes gauge Ёмкость блочного устройства
cmdb_storage_block_device_slave_info gauge Ребро графа стека хранения: deviceslave (LV → md → раздел → диск)
cmdb_storage_physical_disk_info gauge Физический диск (включая скрытые за RAID); лейблы attachment = direct | raid | hba, interface, state_class
cmdb_storage_physical_disk_capacity_bytes gauge Ёмкость физического диска
cmdb_storage_controller_info gauge RAID/HBA-контроллер
cmdb_storage_raid_volume_info gauge RAID-том (виртуальный диск контроллера); volume_wwn, os_device_name для связи с ОС
cmdb_storage_raid_volume_capacity_bytes gauge Ёмкость RAID-тома
cmdb_disks_total / cmdb_disks_total_bytes gauge Число дисков и их суммарная ёмкость
cmdb_nic_info / cmdb_nics_total gauge Физические сетевые карты
cmdb_gpu_info / cmdb_gpus_total gauge Дискретные GPU
cmdb_system_slot_info, cmdb_system_slots_total / _populated gauge Слоты расширения PCIe (SMBIOS Type 9)
cmdb_sata_port_info, cmdb_sata_ports_total / _occupied gauge SATA-порты
cmdb_psu_info gauge Блок питания (SMBIOS Type 39); лейблы status = ok | non_critical | critical | non_recoverable | unknown, present, unplugged
cmdb_psu_total / _present / _healthy gauge Всего/присутствует/здоровых БП
cmdb_inventory_scan_success gauge 1 — скан собрал данные
cmdb_inventory_partial gauge 1 — часть коллекторов упала
cmdb_inventory_scan_timestamp gauge Unix-время последнего рескана
cmdb_inventory_generation gauge Монотонный счётчик изменений состава железа
cmdb_inventory_fingerprint_info gauge =1; хэш текущего инвентаря (лейбл fingerprint)
cmdb_inventory_source_available gauge По источникам (source = smbios | sysfs): 1 — источник доступен

Датчики (плагин sensors)

lm-sensors, только Linux. Лейблы: device (чип), sensor.

Метрика Тип Описание
sensor__temperature__current gauge Текущая температура датчика, °C
sensor__temperature__high / __critical gauge Пороги high/critical, °C (если заданы)
sensor__fan__rpm__current gauge Обороты вентилятора, RPM
sensor__fan__rpm__minimum gauge Минимальные обороты (если заданы)

Облачный провайдер и пакеты (плагины provider_info, package_info)

Метрика Лейблы Тип Описание
provider provider_name, type, virtualization_type gauge =1; обнаруженный облачный провайдер (amazon, azure, google, yandex, hetzner, selectel, …)
package_version package, version_full, version_major, version_minor, version_patch, version_additional gauge =1; версия установленного пакета (сейчас отслеживается sudo); источники — dpkg/dnf/yum

Процессы, контейнеры, cgroups

Процессы (плагин process_info)

Метрики агрегируются по группам (process, username, container); container = ~host для процессов вне контейнеров.

Метрика Доп. лейблы Тип Описание
process__cpu__user / __system rate Потребление CPU группой процессов, ядер (CPU-секунд в секунду)
process__max_cpu_percent_per_thread gauge Максимальная загрузка одного потока в группе, %
process__mem__rss gauge Суммарный RSS, КБ
process__mem__swap gauge Суммарный swap, КБ
process__proc_count state gauge Число процессов по состояниям (running, sleeping, zombie, …)
process__thread_count gauge Суммарное число потоков
process__disk__ops__read / __write rate Дисковые операции группы, оп/с
process__disk__bytes__read / __write rate Дисковый трафик группы, байт/с
process__open_files__count gauge Открытые файловые дескрипторы
process__open_files__max_usage_percent gauge Максимальный процент использования лимита fd в группе
process__uptime gauge Максимальный аптайм процесса группы, секунды

Cgroups (плагин cgroups)

Только Linux. Общие лейблы: cgroup_type = systemd | docker | lxc | k8s, cgroup, container; для k8s — k8s_qos и лейблы пода.

Метрика Доп. лейблы Тип Описание
cgroup__cpu__usage space = user | system counter Потреблённое CPU-время cgroup, секунды
cgroup__cpu__shares gauge CPU shares
cgroup__cpu__quota__period gauge Период CFS-квоты, секунды
cgroup__cpu__quota__normalized gauge Квота в долях ядра (quota/period)
cgroup__cpu__throttling__nr_periods counter Всего CFS-периодов
cgroup__cpu__throttling__nr_throttled counter Периодов с троттлингом
cgroup__cpu__throttling__throttled_time counter Время троттлинга, секунды
cgroup__memory__usage__rss / __cache gauge RSS и page cache cgroup, байты
cgroup__memory__limit gauge Лимит памяти, байты (если установлен)
cgroup__memory__dirty / __writeback gauge Dirty/writeback-страницы, байты
cgroup__memory__pages__in / __out counter Заведено/выгружено страниц
cgroup__memory__pages__major_faults counter Major page faults
cgroup__blkio__bytes operation = read | write, device counter Дисковый трафик cgroup, байты
cgroup__blkio__ops operation, device counter Дисковые операции
cgroup__blkio__limit__bps / __ops operation, device gauge Лимиты пропускной способности/IOPS (если заданы)

Docker-тома (плагин docker)

Метрика Лейблы Тип Описание
docker__container__disk__space__used container, mount_point, device gauge Занятое место на rw-томе контейнера, байты
docker__container__disk__space__available container, mount_point, device gauge Свободное место на томе, байты

Виртуализация

Виртуальные машины (плагины qemu, vmware)

QEMU/KVM обнаруживается автоматически по процессам; VMware настраивается конфигом с адресом vCenter. Общие лейблы VM-метрик: vm_id, vm_name, hypervisor_type, hypervisor_host; для KubeVirt — namespace, pod.

Метрика Доп. лейблы Тип Описание
vm_info state, guest_os gauge =1; идентификация ВМ
vm_nic_info mac, model, netdev gauge =1; одна серия на сетевой интерфейс ВМ
vm_disk_size_bytes drive, file, format, bus, device, device_name gauge Размер виртуального диска, байты
vm_allocated_vcpu gauge Выделено vCPU
vm_allocated_mem_bytes gauge Выделено памяти, байты
vm_cpu_seconds_total mode = user | system counter CPU-время процесса QEMU, секунды
vm_rss_bytes gauge RSS процесса QEMU, байты
vm_net_rx_bytes_total / vm_net_tx_bytes_total counter Сетевой трафик ВМ, байты
vm_blk_read_bytes_total / vm_blk_write_bytes_total device counter Дисковый трафик ВМ, байты
qemu_host_kvm_module_loaded gauge 1 — модуль KVM загружен (host-метрика)
qemu_host_libvirt_socket_present gauge 1 — сокет libvirt существует
qemu_host_vm_count gauge Число QEMU-процессов на хосте

VMware (реалтайм-счётчики vCenter):

Метрика Тип Описание
vm_vmware_cpu_usage_percent gauge Загрузка CPU ВМ, 0–100 %
vm_vmware_memory_active_bytes gauge Активная память гостя, байты
vm_vmware_memory_consumed_bytes gauge Память хоста, потреблённая ВМ
vm_vmware_net_rx_rate_bps / _tx_rate_bps gauge Сетевой трафик, байт/с
vm_vmware_disk_read_rate_bps / _write_rate_bps gauge Дисковый трафик, байт/с
vm_vmware_esxi_info gauge =1; ESXi-хост (лейблы host_name, vendor, model, cpu_model, connection_state, maintenance)
vm_vmware_esxi_cpu_cores gauge Физические ядра хоста
vm_vmware_esxi_cpu_usage_percent gauge Загрузка CPU хоста, %
vm_vmware_esxi_memory_total_bytes / _usage_bytes gauge Память хоста: всего/используется

СУБД и кэши

Все плагины этого раздела автообнаруживаемые: агент находит процесс СУБД и подключается сам. При проблемах доступа публикуется plugin__status с инструкцией.

PostgreSQL (плагин postgresql)

Метрика Лейблы Тип Описание
postgresql__db__size database gauge Размер базы, байты
postgresql__db__commits / __rollbacks database counter Коммиты и роллбэки транзакций
postgresql__db__deadlocks database counter Дедлоки
postgresql__db__tmp_bytes database counter Записано во временные файлы, байты
postgresql__db__max_transaction_age database gauge Возраст старейшей транзакции (XID), только primary
postgresql__db__transactions_left_before_shutdown database gauge Запас XID до аварийной остановки (wraparound)
postgresql__locks__count database, mode gauge Число блокировок по режимам
postgresql__connections__count user, database, state, client_addr gauge Сессии по состояниям (active, idle, idle in transaction, waiting, …)
postgresql__connections__max_transaction_age user, database gauge Максимальный возраст открытой транзакции, секунды
postgresql__autovacuum_workers__common / __wraparound gauge Число воркеров autovacuum (обычных и anti-wraparound)
postgresql__bgwriter__buffers_clean / __buffers_backend / __buffers_alloc / __maxwritten_clean / __buffers_backend_fsync counter Статистика bgwriter (на PostgreSQL 17 — из pg_stat_io)
postgresql__bgwriter__checkpoints_timed / __checkpoints_req counter Чекпойнты по расписанию/по требованию
postgresql__bgwriter__checkpoints_write_time / __checkpoints_sync_time counter Время записи/синхронизации чекпойнтов, секунды
postgresql__bgwriter__buffers_checkpoint counter Буферы, записанные чекпойнтами
postgresql__checkpointer__timed / __req / __write_time / __sync_time / __buffers_written counter Те же значения под новыми именами (PostgreSQL 17 pg_stat_checkpointer)
postgresql__replication__role text master или slave
postgresql__replication__wal__current_xlog_location, postgresql__replication__wal__location__current_lsn gauge Текущая позиция WAL (primary)
postgresql__replication__wal__last_xlog_receive_location, …__location__receive_lsn gauge Полученная позиция WAL (standby)
postgresql__replication__wal__last_xlog_replay_location, …__location__replay_lsn gauge Применённая позиция WAL (standby)
postgresql__replication__lag__seconds gauge Отставание реплики по времени, секунды
postgresql__replication__wal__replay__paused gauge 1 — воспроизведение WAL приостановлено
postgresql__replication__lag__bytes slave_ip, application_name gauge Отставание реплики в байтах WAL (со стороны primary)
postgresql__replication__session_age standby_ip, application_name gauge Возраст сессии репликации, секунды
postgresql__replication__phases__lag__bytes standby_ip, application_name, phase gauge Отставание по фазам: sending_to_standby, writing_standby_wal, flushing_standby_wal, replaying_standby_wal
postgresql__replication__phases__lag__seconds те же gauge Отставание по фазам во времени (PostgreSQL ≥ 10)
postgresql__replication__slots__retained_wal__bytes slot_name, slot_type, database gauge WAL, удерживаемый слотом репликации
postgresql__wal_archiver__success__count / __fail__count counter Успешные/неудачные архивации WAL
postgresql__wal_archiver__last_success__age gauge Секунд с последней успешной архивации
postgresql__wal_archiver__unarchived_files__count / __bytes gauge Неархивированные сегменты WAL: число и объём
postgresql__wal__size__bytes / postgresql__wal__files__count gauge Размер и число WAL-файлов на диске

Статистика запросов (pg_stat_statements, топ-50 запросов + агрегат ~other; лейблы database, user, query) — все rate:

postgresql__query__calls, postgresql__query__rows, postgresql__query__time__total, postgresql__query__time__cpu, postgresql__query__time__disk_read, postgresql__query__time__disk_write, postgresql__query__blocks__hit, postgresql__query__blocks__read, postgresql__query__blocks__written, postgresql__query__blocks__dirtied, postgresql__query__temp_blocks__read, postgresql__query__temp_blocks__written.

Статистика таблиц (топ по каждой базе; лейблы database, schema, table) — счётчики публикуются с суффиксом __rate (rate): postgresql__table__seq_scan__rate, …__idx_scan__rate, …__seq_tuple_read__rate, …__idx_tuple_fetch__rate, …__inserted__rate, …__updated__rate, …__deleted__rate, …__autovacuum_count__rate, …__heap_blks_read__rate, …__heap_blks_hit__rate, …__idx_blks_read__rate, …__idx_blks_hit__rate, …__toast_blks_read__rate, …__toast_blks_hit__rate, …__tidx_blks_read__rate, …__tidx_blks_hit__rate; размеры — gauge: postgresql__table__table_size, postgresql__table__indexes_size.

Настройки — семейство postgresql__settings__<имя параметра>: числовые параметры (например postgresql__settings__max_connections, …__shared_buffers, …__autovacuum_max_workers) — gauge, строковые (например …__wal_level, …__archive_mode, …__data_directory) — text. Публикуются все распознанные параметры pg_settings (~300).

Статусные метрики: plugin__status (подключение), plugin__status__pg_database, …__pg_settings, …__pg_stat_activity, …__pg_stat_replication, …__pg_stat_statements — текст описывает недостающие права или отсутствие расширения.

PgBouncer (плагин pgbouncer)

Метрика Лейблы Тип Описание
pgbouncer__total_requests, pgbouncer__total_query_count database counter Обработанные запросы
pgbouncer__total_received / __total_sent database counter Трафик, байты
pgbouncer__total_query_time / __total_xact_time / __total_wait_time database counter Суммарное время запросов/транзакций/ожидания, секунды
pgbouncer__total_xact_count database counter Транзакции
pgbouncer__databases__pool_size / __reserve_pool / __max_connections database, upstream_addr gauge Настройки пулов
pgbouncer__databases__paused / __disabled database, upstream_addr gauge 0/1 — база на паузе/отключена
pgbouncer__databases__upstream_addr database text Адрес upstream-сервера
pgbouncer__pools__limits__pool_size / __reserve_pool database, user, upstream_addr gauge Лимиты активных пулов
pgbouncer__server_connections__max / __avg database, user, state, upstream_addr gauge Серверные соединения по состояниям (active, idle, login, tested, used)
pgbouncer__server_connection_maxwait__max database, user, upstream_addr gauge Максимальное ожидание серверного соединения, секунды
pgbouncer__clients__count database, user, state, client_address gauge Клиентские соединения по состояниям
pgbouncer__clients__wait__max / __sum database, user, client_address gauge Ожидание клиентов, секунды
pgbouncer__config__<параметр> gauge Числовые параметры из SHOW CONFIG (например pgbouncer__config__max_client_conn)
plugin__status status Статус подключения

MySQL / MariaDB (плагин mysql)

Значения SHOW GLOBAL STATUS / SHOW VARIABLES (counter, если исходная переменная накопительная):

Семейство Метрики
Соединения mysql__connection__max_connections, mysql__connections__aborted_clients, …__aborted_connects, …__connections, mysql__connection__connections_by_state (gauge, лейбл state)
Трафик mysql__traffic__bytes_received, …__bytes_sent
Команды mysql__commands__{select,insert,update,delete,replace,insert_select,replace_select,multi_update,multi_delete,call_procedure}
Prepared statements mysql__prepared_commands__{prepare,execute,dealloc}
Транзакции mysql__transaction_commands__{begin,commit,rollback}
Handler API mysql__handler__{commit,delete,read_first,read_key,read_next,read_prev,read_rnd,read_rnd_next,rollback,savepoint,savepoint_rollback,update,write,prepare}
InnoDB buffer pool mysql__innodb__buffer_pool__usage__{data,dirty,free,misc}, mysql__innodb__buffer_pool__operations__{flushed,read_ahead,read_ahead_evicted,read_ahead_rnd,read_ahead_seq,read_requests,reads_from_disk,wait_free,write_requests}, mysql__innodb__buffer_pool__activity__{pages_created,pages_read,pages_written}
InnoDB I/O mysql__innodb__io__{read_bytes,written_bytes,reads_count,writes_count}, mysql__innodb__{fsyncs,current_pending_fsyncs,current_pending_reads,current_pending_writes}, mysql__innodb__doublewrite__{pages_written,writes_count}
InnoDB log mysql__innodb__log__{waits,write_requests,physical_writes,fsyncs,pending_fsyncs,pending_writes,written_bytes}
InnoDB rows/locks mysql__innodb__rows__{inserted,updated,deletes,read}, mysql__innodb__row_lock__{current_waits,total_time,waits}, mysql__innodb__page_size
MyISAM mysql__myisam__key_cache__{blocks_not_flushed,blocks_unused,blocks_used,reads_requests,reads_from_disk,write_requests,writes_to_disk}
Query cache mysql__query_cache__{free_blocks,total_blocks,hits,inserts,lowmem_prunes,not_cached,queries_in_cache}
Temp/sort/select mysql__tmp__created_{disk_tables,files,tables}, mysql__sort__{merge_passes,range,sorted_rows,scan}, mysql__select__{full_join,full_range_join,range,range_check,scan}
Delayed mysql__delayed__{errors,insert_threads,rows_written,not_flushed_rows}
Прочее mysql__queries_count, mysql__questions_count, mysql__slow_queries, mysql__current_open_files, mysql__current_open_tables, mysql__opened_tables, mysql__locks__{immediate,waited}, mysql__threads__{cached,connected,created,running}, mysql__uptime, mysql__version (text)
Galera/wsrep mysql__wsrep__local_recv_queue__avg, …__local_send_queue__avg, …__flow_control__{received,sent}, …__open_connections, …__open_transactions, …__writesets__received__{count,bytes}, …__writesets__sent__{count,bytes}

Прочие метрики:

Метрика Лейблы Тип Описание
mysql__connections__max_transaction_age user, database gauge Максимальный возраст открытой InnoDB-транзакции, секунды
mysql_gather_error source, reason, mysql_error_code gauge =1 при ошибке сбора части данных
mysql__replication__slave_io_running / __slave_sql_running master_host, channel_name gauge 0/1 — состояние потоков репликации
mysql__replication__seconds_behind_master те же gauge Отставание реплики, секунды
plugin__status status Статус подключения

Статистика запросов (performance schema, топ-50; лейблы database, query) — все rate: mysql__query__calls__rate, mysql__query__total_time__rate, mysql__query__time__lock_wait__rate, mysql__query__rows__sent__rate, mysql__query__rows__examined__rate, mysql__query__rows__sorted__rate, mysql__query__tmp_tables_created__rate (+ лейбл table_type = disk | in-memory), mysql__query__full_join__rate, mysql__query__range_check__rate, mysql__query__full_scan__rate, mysql__query__sort__merge__rate.

MongoDB (плагин mongo)

Метрики собираются пассивным анализом трафика (сниффер); топ-50 запросов. Общие лейблы: query, query_type, db, collection.

Метрика Тип Описание
mongo__query__calls__rate rate Запросов в секунду
mongo__query__total_time__rate rate Суммарное время запросов, секунд в секунду
mongo__query__traffic__in / __out rate Трафик запросов/ответов, байт/с
mongo__query__times__mean / __min / __max gauge Средняя/мин/макс задержка, секунды
mongo__query__times__percentile gauge Перцентили задержки (лейбл percentile = 50 | 95 | 99)

Redis (плагин redis)

Метрика Лейблы Тип Описание
redis__version text Версия Redis
redis__uptime gauge Аптайм, секунды
redis__memory__used / __rss / __lua gauge Память: allocated/RSS/Lua, байты
redis__maxmemory gauge Лимит памяти, байты
redis__cpu__user / __system process = server | children counter CPU-время, секунды
redis__clients__connected / __blocked gauge Подключённые/заблокированные клиенты
redis__clients__connections_received counter Принятые соединения
redis__connections__rejected counter Отклонённые соединения
redis__commands__total_calls counter Всего выполнено команд
redis__commands__calls / __seconds command counter Вызовы и суммарное время по командам
redis__cache__evicted_keys counter Вытеснено ключей
redis__keys__hits / __misses counter Попадания/промахи по ключам
redis__db__keys / __expires db gauge Ключей в базе / с TTL
redis__pubsub__channels / __patterns gauge Каналы и шаблоны pub/sub
redis__persistence__rdb__changes_since_last_save gauge Изменений с последнего сохранения RDB
redis__persistence__rdb__time_since_last_save gauge Секунд с последнего сохранения
redis__persistence__rdb__loading_in_progress / __bgsave_in_progress gauge 0/1 — идёт загрузка/сохранение
redis__persistence__aof__enabled / __rewrite_in_progress gauge 0/1 — AOF включён/идёт rewrite
redis__persistence__aof__current_size / __buffer_length gauge Размер AOF и буфера, байты
redis__persistence__aof__pending_bio_fsync / __delayed_fsync gauge Отложенные fsync
redis__replication__connected_slaves gauge Подключённые реплики (на мастере)
redis__replication__last_io_seconds_ago gauge Секунд с последнего обмена с мастером (на реплике)
redis__replication__sync_in_progress / __sync_left_bytes / __link_down_since_seconds gauge Состояние синхронизации с мастером

Memcached (плагин memcached)

Метрика Лейблы Тип Описание
memcached__version text Версия
memcached__uptime gauge Аптайм, секунды
memcached__cpu__user / __system counter CPU-время (rusage), секунды
memcached__items__current / __total gauge/counter Объектов в кэше сейчас / всего сохранено
memcached__bytes__used / __max / __malloced gauge Занято/лимит/аллоцировано, байты
memcached__connections__current / __total gauge/counter Соединения
memcached__evictions / __reclaimed counter Вытеснения/переиспользования записей
memcached__expired_unfetched / __evicted_unfetched / __crawler_reclaimed / __lrutail_reflocked counter Детализация вытеснений LRU
memcached__traffic__in / __out counter Трафик, байты
memcached__threads gauge Потоки
memcached__command__requests / __hits / __misses / __badval command (get, set, cas, …) counter Статистика по командам
memcached__slab__chunk_size chunk_size gauge Размер чанка slab-класса
memcached__slab__chunks__free / __used chunk_size gauge Свободные/занятые чанки
memcached__slab__bytes__free / __used chunk_size gauge То же в байтах

Elasticsearch (плагин elasticsearch)

Общий лейбл всех метрик — cluster. Кластерные метрики публикует только master-нода.

Метрика Доп. лейблы Тип Описание
elasticsearch__version text Версия
elasticsearch__cluster__status status Здоровье кластера: green — значение 1, иначе 0 + текст статуса
elasticsearch__index__settings index, setting = number_of_replicas | number_of_shards gauge Настройки индексов
elasticsearch__shards__count index, shard_type = primary | replica, shard_state = active | initializing | relocating | unassigned gauge Шарды по типу и состоянию
elasticsearch__index__size index gauge Размер индекса, байты (топ-50 индексов)
elasticsearch__index__docs__count / __deleted index gauge Документы: всего / помечено удалёнными
elasticsearch__index__segments__count / __size index gauge Сегменты Lucene: число и память
elasticsearch__index__operations__count__rate / __time__rate index, operation = get | query | fetch | scroll | merge | index | delete | flush | refresh | warmer | … rate Операции индекса: частота и затраченное время
elasticsearch__index__cache__size / __objects index, cache_type = query | fielddata | request gauge Кэши индекса
elasticsearch__index__cache__hits__rate / __misses__rate / __evictions__rate / __caches__rate index, cache_type rate Активность кэшей
elasticsearch__index__translog__size / __operations__rate index gauge/rate Translog
elasticsearch__http__current_open__rate rate Открытия HTTP-соединений
elasticsearch__transport__rx_count__rate / __rx_bytes__rate / __tx_count__rate / __tx_bytes__rate rate Межнодовый трафик
elasticsearch__script__compilations__rate / __cache_evictions__rate rate Компиляции скриптов
elasticsearch__thread_pool__threads / __queue / __active thread_pool gauge Пулы потоков
elasticsearch__thread_pool__rejected__rate / __completed__rate thread_pool rate Отклонённые/выполненные задачи
elasticsearch__breaker__limit / __estimated breaker gauge Circuit breakers: лимит и оценка, байты
elasticsearch__breaker__overhead breaker gauge Коэффициент overhead
elasticsearch__breaker__tripped__rate breaker rate Срабатывания breaker

Очереди, брокеры, поиск

RabbitMQ (плагин rabbitmq)

Через Management API; топ-50 очередей. Лейблы: vhost, queue.

Метрика Доп. лейблы Тип Описание
rabbitmq__queue__messages gauge Сообщений в очереди
rabbitmq__queue__memory gauge Память очереди, байты
rabbitmq__queue__published__rate rate Скорость публикации, сообщений/с
rabbitmq__queue__delivered__rate ack = manual_ack | auto_ack rate Скорость доставки потребителям
plugin__status status Ошибки: management-плагин выключен, нет прав и т.п.

Kafka (плагин kafka)

Лейблы уровня экземпляра: broker_id, cluster_id. Метрики партиций публикует брокер-лидер партиции.

Метрика Лейблы Тип Описание
kafka__version text Версия Kafka
kafka__brokers__count gauge Число брокеров в кластере
kafka__topic__partition__count topic gauge Число партиций топика
kafka__topic__partition__size topic, partition gauge Размер партиции на диске, байты
kafka__topic__partition__offset__newest / __oldest topic, partition gauge Крайние офсеты партиции
kafka__topic__partition__replication__isr_count topic, partition gauge Число in-sync реплик
kafka__topic__partition__replication__replicas_count topic, partition gauge Число реплик
kafka__consumer_group__status group status Состояние группы: пусто — stable, иначе текст (preparingrebalance, …)
kafka__consumer_group__members__count group gauge Участники группы
kafka__consumer_group__protocol / __protocol_type group text Протокол группы
kafka__consumer_group__topic__partition__offset__committed topic, partition, group, member_host, member_id gauge Закоммиченный офсет группы (лаг = newestcommitted)

ZooKeeper (плагин zookeeper)

Метрика Лейблы Тип Описание
zookeeper__status status Пусто — ОК; zookeeper cluster is down / zookeeper node in standalone mode
plugin__status status Текст please add commands in whitelist, если 4-буквенные команды stat/mntr запрещены
zookeeper__version text Версия
zookeeper__role text Роль ноды (leader, follower)
zookeeper__nodes__current / __expected gauge Нод в ансамбле: фактически / по конфигу
zookeeper__znodes__regular / __ephemerals gauge Число znode: обычных / эфемерных
zookeeper__watchers gauge Число watcher’ов
zookeeper__leader_elections gauge Номер эпохи (число выборов лидера)
zookeeper__current_transaction_number__<role> gauge Счётчик транзакций из zxid (<role> — режим ноды)
zookeeper__client_latency__min / __avg / __max gauge Задержка клиентских запросов, секунды
zookeeper__packets__received / __sent counter Пакеты
zookeeper__outstanding_requests gauge Запросы в обработке
zookeeper__outstanding_requests__limit gauge Лимит (globalOutstandingLimit)
zookeeper__connection__packets__queued / __received / __sent client_ip rate Активность по клиентским соединениям

Sphinx (плагин sphinx)

Метрика Лейблы Тип Описание
sphinx__uptime gauge Аптайм searchd
sphinx__connections__count / __overflows counter Соединения / отказы maxed_out
sphinx__agent__connections / __retries counter Соединения с агентами распределённого поиска
sphinx__query__count query_type = local | distributed counter Запросы
sphinx__query__total_time query_type counter Суммарное время запросов
sphinx__query__time query_type, stage = cpu | local | wait | disk_read counter Время по стадиям
sphinx__query__disk__ops__read / sphinx__query__disk__bytes__read query_type="local" counter Чтения с диска
sphinx__command__calls command counter Вызовы по типам команд (search, update, …)
sphinx__index__documents__count / __bytes index, index_type gauge Документы в индексе: число и объём
sphinx__index__memory__used / __limit index, index_type gauge Память индекса
sphinx__index__disk__used index, index_type gauge Диск, занятый индексом

Resque (плагин resque, по конфигу)

Требует YAML-конфиг с redis_address и prefix.

Метрика Лейблы Тип Описание
resque__tasks__pending queue gauge Задач в очереди
resque__tasks__processed worker, queue rate Обработано задач/с
resque__tasks__failed worker, queue rate Ошибок/с

Веб-серверы и прокси

Nginx (плагин nginx)

Метрики строятся парсингом access-логов (формат определяется автоматически из конфига nginx) и проверкой TLS-сертификатов из конфига. Общие лейблы лог-метрик: file (путь лога), log_format.

Метрика Доп. лейблы Тип Описание
nginx__requests__rate method, status, cache_status, url rate Запросов/с; url — топ-N URL с нормализацией, остальное — ~other
nginx__traffic__rate url rate Отдано байт/с
nginx__response_time__percentiles percentile = 50 | 75 | 95 | 99 gauge Перцентили времени ответа, секунды
nginx__response_time__histogram method, cache_status, url, levels, level rate Гистограмма времени ответа (бакеты по умолчанию 0.5 и 1 с)
nginx__upstream_response_time__percentiles percentile gauge Перцентили времени ответа upstream
nginx__upstream_response_time__histogram как у histogram rate Гистограмма времени ответа upstream
nginx__ssl_certificate__seconds_to_expire certificate_file gauge Секунд до истечения сертификата
nginx__ssl_certificate__revoke_status certificate_file gauge OCSP: 1 — good, 0 — revoked
nginx__ssl_certificate__check_status certificate_file status Ошибка чтения/парсинга сертификата
status access_log или log_format status Проблемы конфигурации: недоступный лог, неразобранный log_format

PHP-FPM (плагин php_fpm)

Через страницу статуса FCGI (pm.status_path). Общий лейбл — pool.

Метрика Доп. лейблы Тип Описание
php_fpm__pool__uptime gauge Аптайм пула, секунды
php_fpm__pool__accepted_connections counter Принятые соединения
php_fpm__pool__listen_queue__current / __limit gauge Очередь запросов: текущая/лимит
php_fpm__pool__processes__count state = active | idle gauge Воркеры по состояниям
php_fpm__pool__processes__limit_reached counter Сколько раз достигался max_children
plugin__status / status pool status Статус-страница выключена / ошибка подключения

Envoy (плагин envoy)

Прозрачный проброс метрик admin-интерфейса Envoy (/stats?format=prometheus): имена и лейблы передаются как есть (например envoy_cluster_upstream_rq_total, envoy_server_live). Передаются только counter и gauge; гистограммы пропускаются.

JVM и Cassandra

JVM (плагин jvm)

Для каждого Java-процесса с включённым JMX (без аутентификации). Лейблы уровня экземпляра: jvm, user.

Метрика Лейблы Тип Описание
jvm__memory__heap__used / __max gauge Heap: используется/максимум, байты
jvm__memory__nonheap__used / __max gauge Non-heap память
jvm__memory__pool__used / __max pool gauge Пулы памяти (Eden, Old Gen, Metaspace, …)
jvm__gc__counter collector counter Сборки мусора по коллекторам
jvm__gc__total_time collector counter Время GC, секунды
jvm__threads__current / __daemon gauge Живые/daemon-потоки
jvm__threads__created counter Всего создано потоков
jvm__uptime gauge Аптайм JVM, миллисекунды
status status JMX disabled, please enable it / JMX authentication enabled, please disable it и т.п.

Cassandra (ветка плагина jvm, публикуется как plugin=cassandra)

Дополнительные лейблы: cluster, datacenter, rack.

Семейство Метрики Лейблы
Версия cassandra__version (text)
Кэши cassandra__row_cache__{max_bytes,used_bytes,hits,requests,entries}, cassandra__key_cache__{…}, cassandra__counter_cache__{…}
Клиентские запросы cassandra__client_requests__{count,unavailables,timeouts,failures,total_seconds} operation (Read/Write/…), опц. consistency_level
Commit log cassandra__commitlog__{waiting_on_segment_allocation,pending_tasks,waiting_on_commit,completed_tasks,total_size}
Компакции cassandra__compaction__{completed_tasks,bytes_compacted,completed_compactions,pending_tasks}
Storage cassandra__storage__{bytes_used,exceptions_count,hints_count,hints_in_progress}
CQL cassandra__cql__prepared_statements__{executed,count,evicted}, cassandra__cql__regular_statements__executed
Read repair cassandra__read_repair__{attempted,blocking,background}
Межнодовое взаимодействие cassandra__nodes__{messages_received,messages_sent,pending_responses,pending_requests,messages_dropped,timeouts} node, для dropped опц. type = large | small
Отброшенные сообщения cassandra__dropped_messages__count message_type
Таблицы cassandra__table__{waiting_on_memtable_free,disk_space_used,sstables_count,pending_flushes,snapshots_size,compression_ratio,pending_compactions,speculative_retries,mean_row_size,min_row_size,max_row_size}, cassandra__table__row_cache__{hit,miss,hit_out_of_range}, cassandra__table__ops__{count,total_time} (+operation), cassandra__memtable__{size__heap,size__off_heap,switch_count,columns_count}, cassandra__bloom_filter__{false_positives,disk_space_used} keyspace, table

Почта

Почтовые серверы (плагин mail)

Автообнаружение Exim и Postfix. Метрики очередей — прямой опрос; метрики потока писем — парсинг логов. Общий лейбл — mta = exim | postfix; у лог-метрик дополнительно file.

Метрика Доп. лейблы Тип Описание
mail__queue__size queue (для postfix: maildrop, hold, incoming, active, deferred; для exim: main) gauge Сообщений в очереди
mail__messages__received rate Принято писем/с
mail__messages__delivered postfix: recipient_domain rate Доставлено писем/с
mail__messages__deferred rate Отложено/с
mail__messages__failed rate Провалено (bounce)/с
mail__delivery_errors response_code (SMTP 4xx/5xx) rate Ошибки доставки по кодам
mail__delivery_time__histogram recipient_domain, levels, level rate Гистограмма времени доставки Postfix (бакеты 5 с/1 мин/5 мин/30 мин)
status status Ошибка инициализации парсера логов Exim

Плагин syslog собственных метрик не публикует — он находит лог-файлы для Postfix.

Безопасность

Права файлов (плагин security_file_permissions)

Метрика Лейблы Тип Описание
security_file_permissions file_path, mode gauge Существование (0/1) и режим доступа критичных файлов: /etc/passwd, /etc/shadow, /etc/group, /etc/gshadow, /etc/hosts, /etc/fstab и др.
security_file_permissions_errors_total gauge Число файлов, для которых проверка завершилась ошибкой

Пользовательские метрики

Плагины этого раздела публикуют метрики с именами, которые задаёт пользователь или которые выводятся из данных. Настраиваются YAML-файлами в config.d/.

StatsD (плагин statsd)

Встроенный StatsD-сервер (UDP). Имя метрики берётся из StatsD-пакета; части имени вида key=value или key_is_value извлекаются в лейблы. Значения лейблов, начинающиеся с /, нормализуются как URL-пути; password заменяется на ~hidden.

Тип StatsD Публикуемые метрики
gauge (g) <имя> — gauge
counter (c, m) <имя>__rate — rate (события/с)
timer (ms, h) <имя>__lower, <имя>__upper (мин/макс), <имя>__rate (событий/с), <имя>__sum (сумма/с), <имя>__mean (среднее), <имя>__percentile с лейблом percentile = 50 | 75 | 90 | 95 | 97 | 99; значения в секундах
set (s) не поддерживается

Logparser (плагин logparser)

Превращает строки логов в метрики по конфигу: regex + список metrics с типами rate, threshold (гистограмма), percentiles, max, min. Имя метрики — поле name из конфига (как есть, точки → __). Лейблы — из конфига; поддерживаются выражения, top-N переменные (redкие значения → ~other) и разбор User-Agent. На все метрики добавляется лейбл file.

Метрика Тип Описание
<имя из конфига> rate/gauge Пользовательская метрика; для threshold добавляются лейблы levels, level; для percentilespercentile
logparser__lines__succeeded rate Успешно разобранных строк/с
logparser__lines__unmatched rate Строк, не подошедших под regex
logparser__lines__failed rate Строк с ошибкой разбора значений

SQL-запросы (плагины mysql_query, postgresql_query, mssql_query, clickhouse_query)

Выполняет SQL из конфига. Имя метрики — поле metric_name. Колонка результата value — значение; остальные колонки становятся лейблами.

Метрика Тип Описание
<metric_name> gauge Значения строк результата
status status Ошибка подключения/запроса или ОК

Redis-запросы (плагин redis_query)

Выполняет команды Redis из конфига. Имя метрики: <ключ>__<команда> (например GET mykeymykey__get); аргументы команды попадают в лейбл param.

Выполнение команд (плагин execute)

Запускает исполняемый файл и разбирает stdout (regex с именованными группами или JSON). Имя метрики — из конфига (name) или из поля name JSON.

Метрика Тип Описание
<имя> gauge/text Значения из вывода команды
status status Код возврата/ошибка разбора
duplicate_metric_count gauge Число задублированных метрик в выводе

HTTP-проверки (плагин http)

Выполняет HTTP-запрос; метрики извлекаются regex-группами из тела ответа (metrics[].metric в конфиге).

Метрика Тип Описание
<имя из конфига> gauge Значение из тела ответа
http__request_time gauge Время выполнения запроса, секунды
status status Ошибка запроса/несоответствие ответа

Go expvar (плагин expvar)

Читает /debug/vars Go-приложения; публикуется фиксированный набор из memstats:

go__memory__bytes__alloc, go__memory__bytes__sys, go__memory__total_alloc, go__memory__ops (лейбл operation = lookup | malloc | free), go__memory__heap__alloc, go__memory__heap__sys, go__memory__heap__bytes (лейбл state = used | idle), go__gc__count, go__gc__total_pause, go__gc__max_pause, плюс status.

Prometheus-экспортёры (плагин prometheus)

Скрейпит любой OpenMetrics/Prometheus endpoint и передаёт метрики с исходными именами и лейблами (префиксы не добавляются). Дополнительно у каждой метрики появляется лейбл metric_type (тип из exposition). Гистограммы разворачиваются в <имя>_count, <имя>_sum, <имя>_bucket (+le); summary — в <имя>_count, <имя>_sum, <имя> (+quantile). Фильтрация — metrics_white_list / metrics_black_list по префиксу имени; лимит серий на endpoint — 5000 (при превышении публикуется только plugin__status с ошибкой).

Служебные метрики: status (успешность скрейпа), plugin__status (лейбл source — файл конфига).

Служебные метрики агента

Самоконтроль (плагины heartbeat, okagent_stat)

Метрика Лейблы Тип Описание
okagent_heartbeat gauge =1; признак жизни агента
okagent_up gauge Аптайм процесса агента, секунды
okagent_uuid text UUID агента
okagent__version text Версия агента
okagent__memstats__alloc / __sys / __heap__* / __stack__* / … gauge Память Go-рантайма агента (полный набор runtime.MemStats)
okagent__gc__time / __count counter GC агента: суммарное время пауз и число циклов
lock_status agent_random_uuid gauge 0 — lock-файл захвачен нормально; 1 — агент запущен повторно; 2 — ошибка проверки

Внутренние счётчики (через плагин okagent_stat)

Внутренние счётчики публикуются с префиксом okagent__. Основные семейства:

Метрика Лейблы Описание
okagent__agent__stale_nans, …__plugin_metrics_swapped, …__frequent_packages, …__multipackage_labelset, …__duplicate_labelset, …__plugin_instances, …__duplicate_ls, …__dns_fallback по счётчику Диагностика конвейера метрик: staleness-маркеры, дубликаты, DNS-фолбэки
okagent__metric_group__metrics_dropped reason = timestamp | cardinality | invalid, pname Отброшенные метрики: устаревший timestamp, превышение кардинальности, невалидное имя
okagent__metric_writer__metricpacks_dropped, …__metrics_dropped, …__buffer_input_metrics, …__switch_proxy, okagent__writer__empty_labels writer, reason Транспорт: переполнение буфера, переключение на прокси
okagent__scheduler__ticks_skipped obj_name, func_name Пропущенные тики планировщика (плагин не успел за интервал)
okagent__process_multiplexer__pushes_skipped subscriber Пропуски раздачи списка процессов подписчикам
okagent__statsd__packets__udp, …__errors, …__measurements, …__metrics type, mtype Диагностика StatsD-сервера
okagent__sniffer__errors, …__skipped_packets, …__non_data_packets, …__duplicate_packets error, proto Диагностика сниффера (MongoDB)
okagent__mongo__errors error Ошибки разбора протокола MongoDB
okagent__pg__settings__unknown_variables / __missed_variables instance Нераспознанные/недополученные параметры pg_settings

Внутренние метрики доставки (плагин prometheus_internal_scraper)

Публикует всё из внутреннего Prometheus-реестра агента — прежде всего метрики подсистемы доставки remote write (odarix_core_delivery_*): состояние очередей, отправка, refill, транспорт. Имена передаются как есть.

Конвенции статусных метрик

Метрика Описание
status Статус экземпляра плагина (у конфигурируемых и части автообнаруживаемых)
plugin__status Статус интеграции: пустой текст (значение 1) — сбор работает; текст ошибки (значение 0) — что нужно исправить
plugin__status__invalid_names Появляется, если плагин сгенерировал метрики с невалидными именами (они отброшены; список — в тексте)