Стадия жизненного цикла модуля: General Availability
У модуля есть требования для установки
Справочник по всем метрикам, которые собирает и отправляет агент Deckhouse Observability Platform (opAgent). Метрики сгруппированы по смыслу: базовые системные, диски, сеть, оборудование, процессы и контейнеры, виртуализация, СУБД, очереди, веб-серверы, JVM, почта, безопасность, пользовательские и служебные.
Как читать этот справочник
Имена метрик
Внутри агента имена метрик используют точки (cpu.usage.user). При отправке в хранилище имена преобразуются в Prometheus-совместимую форму:
- точка
.заменяется на__(двойное подчёркивание):cpu.usage.user→cpu__usage__user; - дефис
-заменяется на____(четыре подчёркивания); - к имени, начинающемуся с цифры, добавляется префикс
___:1min→___1min.
В этом документе все имена приведены в том виде, в котором они хранятся и запрашиваются (то есть с __).
Общие лейблы
Каждая метрика агента автоматически получает лейблы:
| Лейбл | Значение |
|---|---|
job, okagent_plugin |
имя плагина, собравшего метрику (cpu, postgresql, nginx, …) |
conf, okagent_plugin_instance |
экземпляр плагина: путь к конфигу, адрес сервиса или контейнер |
instance |
hostname сервера, на котором работает агент |
Для метрик из контейнеров Kubernetes дополнительно добавляются k8s_namespace, k8s_pod, k8s_container, k8s_namespace_pod. Пользовательские лейблы из секции labels: конфига плагина добавляются ко всем его метрикам.
В таблицах ниже перечислены только собственные лейблы метрик — общие не повторяются.
Типы метрик
| Тип | Описание |
|---|---|
| gauge | мгновенное значение (объём памяти, число соединений) |
| counter | монотонно растущий счётчик (байты с момента старта); скорость считается функцией rate() |
| rate | скорость, уже посчитанная агентом за интервал сбора (~60 секунд); rate() применять не нужно |
| text | текстовое значение (версия, MAC-адрес). Хранится как серия со значением лейбла value=<текст> и лейблом metric_type="text" |
| status | статусная метрика: значение 1 и value="empty" — всё хорошо; значение 0 и value=<текст ошибки> — проблема |
Статус интеграций
Все автообнаруживаемые интеграции (PostgreSQL, MySQL, Redis, …) публикуют статусную метрику status или plugin__status: пустой текст — сбор работает, текст с ошибкой — что мешает сбору (нет прав, недоступен порт и т.п.).
Базовые системные метрики
CPU (плагин cpu)
Собирается автоматически на каждом сервере.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
cpu__logical_cores |
— | gauge | Число логических ядер |
cpu__physical_sockets |
— | gauge | Число физических CPU-сокетов |
cpu__physical_cores |
— | gauge | Суммарное число физических ядер |
cpu__usage__user |
— | rate | Доля времени CPU в user mode, % |
cpu__usage__system |
— | rate | Доля времени CPU в system mode, % |
cpu__usage__nice |
— | rate | Доля времени CPU с изменённым приоритетом (nice), % |
cpu__usage__iowait |
— | rate | Доля времени ожидания дискового ввода-вывода, % |
cpu__usage__irq |
— | rate | Доля времени обработки аппаратных прерываний, % |
cpu__usage__softirq |
— | rate | Доля времени обработки программных прерываний, % |
cpu__usage__steal |
— | rate | Доля времени, «украденного» гипервизором, % |
user, system, nice, idle, iowait, irq, softirq, steal |
— | counter | Накопленное время CPU по режимам, секунды (legacy-имена) |
cpu__frequency__mhz |
core |
gauge | Текущая частота ядра, МГц |
cpu__governor |
core, governor |
gauge | Признак (=1) активного scaling governor ядра (только Linux) |
cpu_flags |
model_name, flag |
gauge | Признак (=1) наличия CPU-флага (avx, sse4 и т.п.) |
cpu__thermal_throttle__core_throttle_count |
cpu |
counter | Число событий thermal throttling ядра (только Linux) |
cpu__thermal_throttle__package_throttle_count |
cpu |
counter | Число событий thermal throttling пакета CPU (только Linux) |
Память и swap (плагин memory)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
memory__total |
— | gauge | Объём RAM, байты |
memory__available |
— | gauge | Доступная память (с учётом реклейма кэшей), байты |
memory__usage__used |
— | gauge | Используемая память (total − free − buffers − cached), байты |
memory__usage__free |
— | gauge | Свободная память, байты |
memory__usage__buffers |
— | gauge | Память в buffers, байты |
memory__usage__cached |
— | gauge | Память в page cache, байты |
total, available, free, buffers, cached |
— | gauge | Те же значения (legacy-имена) |
memory__errors |
type = correctable | uncorrectable |
counter | Ошибки памяти ECC из EDAC (только Linux, при наличии /sys/devices/system/edac) |
memory__numa__allocated |
node, allocation = local_node | other_node | interleaved |
counter | Аллокации страниц по NUMA-нодам (только при ≥2 нодах) |
swap__total |
— | gauge | Размер swap, байты |
swap__space__free |
— | gauge | Свободный swap, байты |
swap__space__used |
— | gauge | Занятый swap, байты |
swap__io__in |
— | rate | Скорость подкачки страниц в память, страниц/с |
swap__io__out |
— | rate | Скорость выгрузки страниц в swap, страниц/с |
swap_total, swap_free |
— | gauge | Размер и свободный swap (legacy-имена) |
swap_in, swap_out |
— | counter | Накопленные счётчики swap-страниц (legacy-имена) |
Load average (плагин load_average)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
load_average__1min |
— | gauge | Средняя загрузка за 1 минуту |
load_average__5min |
— | gauge | Средняя загрузка за 5 минут |
load_average__15min |
— | gauge | Средняя загрузка за 15 минут |
___1min, ___5min, ___15min |
— | gauge | Те же значения (legacy-имена) |
Информация об ОС (плагин uname)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
uname |
os, machine, distrib, version, kernel, gather_tool |
gauge | Признак (=1) с метаданными ОС: дистрибутив, версия, ядро, архитектура |
host__uptime |
— | gauge | Аптайм сервера, секунды |
os, machine, distrib, version, kernel |
— | text | Отдельные текстовые метрики с теми же значениями |
uname_gather_error |
— | gauge | =1, если не удалось определить дистрибутив |
Время и NTP (плагин time)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
time__ntp__status |
— | status | Статус опроса NTP: пусто — ОК, текст — ошибка (серверы не найдены, таймаут) |
time__current_offset, time__offset__ntp |
— | gauge | Смещение локальных часов относительно NTP, секунды (может быть отрицательным) |
NTP-серверы берутся из /etc/ntp.conf, при отсутствии — pool.ntp.org.
Идентификация хоста (плагины metadata, machine_identity)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
machine_identity |
machine_id, source = dmi_uuid | dmi_serial | machine_id |
gauge | Признак (=1) со стабильным идентификатором машины (DMI UUID, серийный номер или /etc/machine-id) |
local_metadata__host__hostname_status |
— | status | Отслеживание смены hostname: текст при изменении |
local_metadata__host__group |
— | text | Группа хоста из локального конфига агента (если задана) |
local_metadata__host__description |
— | text | Описание хоста из локального конфига (если задано) |
Диски и хранилище
Файловые системы (плагин disk)
Для каждого смонтированного раздела; лейбл mount_point.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
bytes_total |
mount_point |
gauge | Общий размер файловой системы, байты |
bytes_used, disk__partition__bytes_used |
mount_point |
gauge | Занято, байты |
disk__partition__bytes_available, disk__partition__space__available |
mount_point |
gauge | Доступно пользователю, байты |
disk__partition__bytes_reserved, disk__partition__space__reserved |
mount_point |
gauge | Зарезервировано для root, байты |
disk__partition__space__used |
mount_point |
gauge | Занято, байты |
inodes_total |
mount_point |
gauge | Всего inode |
inodes_used, disk__partition__inodes__used |
mount_point |
gauge | Занято inode |
disk__partition__inodes__free |
mount_point |
gauge | Свободно inode |
disk__partition__read_write |
mount_point |
gauge | 1 — раздел смонтирован rw, 0 — ro |
fs, disk__partition__fs |
mount_point |
text | Тип файловой системы (ext4, xfs, …) |
device, disk__partition__device |
mount_point |
text | Блочное устройство раздела |
mount_options, disk__partition__mount_options |
mount_point |
text | Опции монтирования |
disk__fs__errors |
device, fs="ext4" |
counter | Счётчик ошибок ext4 из /sys/fs/ext4/*/errors_count (только Linux) |
Дисковый ввод-вывод (плагин disk)
Скорости считаются агентом за интервал сбора.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
disk__device__ops__read |
device, pci_bdf |
rate | Операций чтения в секунду на блочном устройстве |
disk__device__ops__write |
device, pci_bdf |
rate | Операций записи в секунду |
disk__device__bytes__read |
device, pci_bdf |
rate | Прочитано байт/с |
disk__device__bytes__write |
device, pci_bdf |
rate | Записано байт/с |
disk__device__io_time__read |
device, pci_bdf |
rate | Время чтения, мс на секунду |
disk__device__io_time__write |
device, pci_bdf |
rate | Время записи, мс на секунду |
disk__device__io_time__total |
device, pci_bdf |
rate | Полное время I/O, мс на секунду (утилизация) |
disk__partition__ops__read / __write |
mount_point |
rate | Операций чтения/записи в секунду по разделу (включая ZFS-датасеты) |
disk__partition__bytes__read / __write |
mount_point |
rate | Байт/с чтения/записи по разделу |
SMART (плагин disk)
Диагностика здоровья дисков. ATA-атрибуты читаются напрямую (SG_IO), NVMe — через ioctl, SCSI/SAS — через smartctl. Все метрики имеют лейблы device (например /dev/sda) и pci_bdf.
| Метрика | Тип | Описание |
|---|---|---|
disk_smart_has_smartctl |
gauge | 1 — утилита smartctl установлена на хосте |
disk_smart_device_model |
text | Модель диска (ATA IDENTIFY) |
ATA-атрибуты — семейство disk_smart_<attr>_value (нормализованное значение 0–255), disk_smart_<attr>_raw (сырое значение, где определён парсер), disk_smart_<attr>_threshold (порог отказа). Поддерживаемые <attr>:
<attr> (SMART ID) |
Описание |
|---|---|
raw_read_error_rate (1) |
Ошибки чтения с поверхности |
reallocated_sectors_ct (5) |
Переназначенные секторы (>0 — деградация) |
power_on_hours (9) |
Часы наработки |
spin_retry_count (10) |
Повторные попытки раскрутки шпинделя |
power_cycle_count (12) |
Циклы включения питания |
wear_leveling_count (177) |
Износ SSD Samsung (value = остаток ресурса, %) |
program_fail_cnt_total (181) / erase_fail_cnt_total (182) |
Ошибки программирования/стирания NAND |
end_to_end_error (184) |
Ошибки сквозного контроля целостности |
reported_uncorrect (187) |
Неисправимые ошибки |
command_timeout (188) |
Таймауты команд |
temperature_celsius (194) |
Температура, °C (raw) |
hardware_ecc_recovered (195) |
Исправленные ECC-ошибки |
reallocated_event_count (196) |
События переназначения |
offline_uncorrectable (198) |
Неисправимые секторы offline-проверки |
udma_crc_error_count (199) |
CRC-ошибки интерфейса (кабель) |
percent_lifetime_remain (202) / ssd_life_left (231) / media_wearout_indicator (233) |
Остаток ресурса SSD, % |
total_lbas_written (241) / total_lbas_read (242) |
Всего записано/прочитано секторов |
NVMe — все gauge:
| Метрика | Описание |
|---|---|
disk_smart_nvme_available_spare |
Остаток резервных блоков, % |
disk_smart_nvme_available_spare_threshold |
Порог предупреждения по резерву, % |
disk_smart_nvme_percentage_used |
Израсходованный ресурс, % (0–255, >100 — сверх номинала) |
disk_smart_nvme_temperature_celsius |
Температура контроллера, °C |
disk_smart_nvme_media_errors |
Неисправимые ошибки носителя |
disk_smart_nvme_power_on_hours |
Часы наработки |
disk_smart_nvme_unsafe_shutdowns |
Небезопасные отключения питания |
disk_smart_nvme_power_cycles |
Циклы питания |
disk_smart_nvme_data_units_read / _written |
Прочитано/записано (1 unit = 500 КиБ) |
disk_smart_nvme_host_read_commands / _write_commands |
Команды чтения/записи от хоста |
disk_smart_nvme_critical_warning |
Сырой байт критических предупреждений (0 — норма) |
disk_smart_nvme_critical_warning_spare_below |
1 — резерв исчерпан |
disk_smart_nvme_critical_warning_temp_exceeded |
1 — перегрев |
disk_smart_nvme_critical_warning_reliability_degraded |
1 — деградация надёжности |
disk_smart_nvme_critical_warning_read_only |
1 — диск перешёл в read-only |
disk_smart_nvme_critical_warning_backup_failed |
1 — отказ резервного питания |
SCSI/SAS (через smartctl) — все gauge:
| Метрика | Описание |
|---|---|
disk_smart_scsi_temperature_celsius |
Температура, °C |
disk_smart_scsi_grown_defects |
Приобретённые дефекты (grown defect list) |
disk_smart_scsi_non_medium_errors |
Ошибки, не связанные с носителем |
disk_smart_scsi_read_uncorrected / _write_uncorrected / _verify_uncorrected |
Неисправленные ошибки чтения/записи/верификации |
disk_smart_scsi_info_exceptions |
1 — SMART-статус «не пройден» |
RAID (плагин raid)
Аппаратные контроллеры (MegaRAID/storcli, Adaptec/arcconf, HPE/ssacli) и программный Linux md. Только Linux. controller_id: megaraid:0, hpe:0, adaptec:1, soft-raid. Лейбл state_class — нормализованное состояние: healthy, rebuild, predictive, failed, offline, unknown (для массивов: optimal, degraded, offline, rebuilding, unknown).
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
raid_controller_info |
controller_id, model, serial, firmware, driver |
gauge | =1; инвентарная запись контроллера |
raid_controller_state |
controller_id, state_class, raw_state |
gauge | =1; состояние контроллера |
raid_controller_temperature_celsius |
controller_id |
gauge | Температура контроллера, °C |
raid_controller_bbu |
controller_id, state_class, raw_state |
gauge | =1; состояние батареи (BBU) |
raid_controller_bbu_health_percent |
controller_id |
gauge | Здоровье батареи, 0–100 % |
raid_controller_cachevault |
controller_id, state_class, raw_state |
gauge | =1; состояние CacheVault (MegaRAID) |
raid_array_info |
controller_id, array, raid_level, array_type |
gauge | =1; инвентарная запись массива (VD/LD) |
raid_array_state |
controller_id, array, state_class, raw_state |
gauge | =1; состояние массива (и md-массивов) |
raid_pd_state |
controller_id, slot_id, model, serial, wwn, media_type, state_class, raw_state |
gauge | =1; состояние физического диска за контроллером |
raid_md_degraded |
array, controller_id="soft-raid" |
gauge | 1 — md-массив деградирован |
raid_md_rebuild_pct |
array, controller_id="soft-raid" |
gauge | Прогресс ребилда md, % |
plugin__status |
controller |
status | Пустой текст — сбор ОК; текст — контроллер обнаружен по PCI-драйверу, но CLI-утилита недоступна или парсинг упал |
Сеть
Сетевые интерфейсы (плагин net)
Для каждого интерфейса, кроме veth*; лейбл interface.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
net__interface__bytes__in / __out |
interface |
rate | Байт/с принято/отправлено |
net__interface__packets__in / __out |
interface |
rate | Пакетов/с |
net__interface__errors__in / __out |
interface |
rate | Ошибок/с |
net__interface__drops__in / __out |
interface |
rate | Отброшенных пакетов/с |
in_bytes, in_packets, in_errors, in_dropped, out_bytes, out_packets, out_errors, out_dropped |
interface |
counter | Накопленные счётчики из /proc/net/dev (legacy-имена) |
net__interface__status, status |
interface |
gauge | 1 — интерфейс UP, 0 — DOWN |
mtu |
interface |
gauge | MTU интерфейса |
hw_address |
interface |
text | MAC-адрес |
net__ip__status |
interface, ip, version = v4 | v6 |
gauge | =1; признак наличия IP-адреса на интерфейсе |
ipv4_addresses, ipv6_addresses |
interface |
text | JSON-списки адресов интерфейса |
net__conntrack__count |
— | gauge | Текущее число записей conntrack (только Linux) |
net__conntrack__max |
— | gauge | Лимит таблицы conntrack |
Сокеты и TCP (плагин netstat)
Только Linux; сбор в сетевом пространстве имён хоста.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
netstat__protocol__packets__in / __out |
protocol = tcp | udp | icmp | ip |
counter | Принятые/отправленные пакеты (сегменты, датаграммы) по протоколу |
netstat__protocol__packets__errors |
protocol, error |
counter | Ошибки протокола: для UDP — NoPorts, RcvbufErrors, SndbufErrors, InErrors; для TCP — OutRsts, InErrs; для IP — InHdrErrors, InAddrErrors, InUnknownProtos, InDiscards, OutNoRoutes, ReasmFails, FragFails |
netstat__protocol__packets__retransmits |
protocol="tcp" |
counter | TCP-ретрансмиты |
netstat__listen__status |
listen_ip, listen_port |
gauge | =1 для каждого слушающего порта (при >200 портов группируются в диапазоны) |
netstat__listen__current_ack_backlog |
listen_ip, listen_port |
gauge | Текущий backlog очереди accept |
netstat__listen__max_ack_backlog |
listen_ip, listen_port |
gauge | Максимальный backlog |
netstat__connections__inbound__count |
listen_ip, listen_port, remote_ip, state |
gauge | Число входящих TCP-соединений по состоянию (ESTABLISHED, TIME_WAIT, SYN_RECV, …) |
netstat__connections__outbound__count |
remote_ip, state |
gauge | Число исходящих соединений по состоянию |
netstat__connections__inbound__with_read_queue / outbound… |
как у count | gauge | Соединения с непустой очередью чтения |
netstat__connections__inbound__with_write_queue / outbound… |
как у count | gauge | Соединения с непустой очередью записи |
netstat__connections__inbound__rtt / outbound… |
как у count + percentile="95" |
gauge | 95-й перцентиль RTT соединений, секунды |
okagent__netstat__listen__status |
— | status | Текст too many listen ports при усечении списка портов |
Нелокальные удалённые адреса агрегируются в remote_ip="~nonlocal".
SNMP-устройства (плагин netdev, по конфигу)
Опрос сетевого оборудования по SNMP v2c (IF-MIB). Настраивается YAML-файлом с host и community.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
in_bytes / out_bytes |
interface, description |
counter | Принято/отправлено байт на порту устройства |
in_packets / out_packets |
interface, description |
counter | Пакеты |
speed |
interface, description |
gauge | Скорость порта, байт/с |
Оборудование и инвентаризация
Аппаратная инвентаризация (плагин cmdb)
Полная инвентаризация железа bare-metal-серверов: SMBIOS, sysfs, CLI RAID-утилиты. На виртуальных машинах плагин отключается. Все *_info-метрики — gauge со значением 1, идентификация — через лейблы (component_key, serial, model, manufacturer и др.). Рескан раз в 5 минут.
| Метрика | Тип | Описание |
|---|---|---|
cmdb_system_info |
gauge | Система (SMBIOS Type 1): производитель, модель, серийный номер |
cmdb_baseboard_info |
gauge | Материнская плата (Type 2) |
cmdb_bios_info |
gauge | BIOS (Type 0) |
cmdb_chassis_info |
gauge | Шасси (Type 3) |
cmdb_cpu_socket_info |
gauge | Одна серия на CPU-сокет |
cmdb_cpu_sockets_total / _populated |
gauge | Всего/занято CPU-сокетов |
cmdb_memory_slot_info |
gauge | Одна серия на DIMM-слот |
cmdb_memory_slots_total / _populated |
gauge | Всего/занято слотов памяти |
cmdb_memory_total_bytes |
gauge | Установлено памяти, байты |
cmdb_memory_max_capacity_bytes |
gauge | Максимальная ёмкость по SMBIOS |
cmdb_storage_block_device_info |
gauge | Одна серия на блочное устройство (/sys/class/block: диски, разделы, LVM, md); лейбл type = physical_disk | raid_volume | partition | lvm | mdraid | unknown |
cmdb_storage_block_device_capacity_bytes |
gauge | Ёмкость блочного устройства |
cmdb_storage_block_device_slave_info |
gauge | Ребро графа стека хранения: device → slave (LV → md → раздел → диск) |
cmdb_storage_physical_disk_info |
gauge | Физический диск (включая скрытые за RAID); лейблы attachment = direct | raid | hba, interface, state_class |
cmdb_storage_physical_disk_capacity_bytes |
gauge | Ёмкость физического диска |
cmdb_storage_controller_info |
gauge | RAID/HBA-контроллер |
cmdb_storage_raid_volume_info |
gauge | RAID-том (виртуальный диск контроллера); volume_wwn, os_device_name для связи с ОС |
cmdb_storage_raid_volume_capacity_bytes |
gauge | Ёмкость RAID-тома |
cmdb_disks_total / cmdb_disks_total_bytes |
gauge | Число дисков и их суммарная ёмкость |
cmdb_nic_info / cmdb_nics_total |
gauge | Физические сетевые карты |
cmdb_gpu_info / cmdb_gpus_total |
gauge | Дискретные GPU |
cmdb_system_slot_info, cmdb_system_slots_total / _populated |
gauge | Слоты расширения PCIe (SMBIOS Type 9) |
cmdb_sata_port_info, cmdb_sata_ports_total / _occupied |
gauge | SATA-порты |
cmdb_psu_info |
gauge | Блок питания (SMBIOS Type 39); лейблы status = ok | non_critical | critical | non_recoverable | unknown, present, unplugged |
cmdb_psu_total / _present / _healthy |
gauge | Всего/присутствует/здоровых БП |
cmdb_inventory_scan_success |
gauge | 1 — скан собрал данные |
cmdb_inventory_partial |
gauge | 1 — часть коллекторов упала |
cmdb_inventory_scan_timestamp |
gauge | Unix-время последнего рескана |
cmdb_inventory_generation |
gauge | Монотонный счётчик изменений состава железа |
cmdb_inventory_fingerprint_info |
gauge | =1; хэш текущего инвентаря (лейбл fingerprint) |
cmdb_inventory_source_available |
gauge | По источникам (source = smbios | sysfs): 1 — источник доступен |
Датчики (плагин sensors)
lm-sensors, только Linux. Лейблы: device (чип), sensor.
| Метрика | Тип | Описание |
|---|---|---|
sensor__temperature__current |
gauge | Текущая температура датчика, °C |
sensor__temperature__high / __critical |
gauge | Пороги high/critical, °C (если заданы) |
sensor__fan__rpm__current |
gauge | Обороты вентилятора, RPM |
sensor__fan__rpm__minimum |
gauge | Минимальные обороты (если заданы) |
Облачный провайдер и пакеты (плагины provider_info, package_info)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
provider |
provider_name, type, virtualization_type |
gauge | =1; обнаруженный облачный провайдер (amazon, azure, google, yandex, hetzner, selectel, …) |
package_version |
package, version_full, version_major, version_minor, version_patch, version_additional |
gauge | =1; версия установленного пакета (сейчас отслеживается sudo); источники — dpkg/dnf/yum |
Процессы, контейнеры, cgroups
Процессы (плагин process_info)
Метрики агрегируются по группам (process, username, container); container = ~host для процессов вне контейнеров.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
process__cpu__user / __system |
— | rate | Потребление CPU группой процессов, ядер (CPU-секунд в секунду) |
process__max_cpu_percent_per_thread |
— | gauge | Максимальная загрузка одного потока в группе, % |
process__mem__rss |
— | gauge | Суммарный RSS, КБ |
process__mem__swap |
— | gauge | Суммарный swap, КБ |
process__proc_count |
state |
gauge | Число процессов по состояниям (running, sleeping, zombie, …) |
process__thread_count |
— | gauge | Суммарное число потоков |
process__disk__ops__read / __write |
— | rate | Дисковые операции группы, оп/с |
process__disk__bytes__read / __write |
— | rate | Дисковый трафик группы, байт/с |
process__open_files__count |
— | gauge | Открытые файловые дескрипторы |
process__open_files__max_usage_percent |
— | gauge | Максимальный процент использования лимита fd в группе |
process__uptime |
— | gauge | Максимальный аптайм процесса группы, секунды |
Cgroups (плагин cgroups)
Только Linux. Общие лейблы: cgroup_type = systemd | docker | lxc | k8s, cgroup, container; для k8s — k8s_qos и лейблы пода.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
cgroup__cpu__usage |
space = user | system |
counter | Потреблённое CPU-время cgroup, секунды |
cgroup__cpu__shares |
— | gauge | CPU shares |
cgroup__cpu__quota__period |
— | gauge | Период CFS-квоты, секунды |
cgroup__cpu__quota__normalized |
— | gauge | Квота в долях ядра (quota/period) |
cgroup__cpu__throttling__nr_periods |
— | counter | Всего CFS-периодов |
cgroup__cpu__throttling__nr_throttled |
— | counter | Периодов с троттлингом |
cgroup__cpu__throttling__throttled_time |
— | counter | Время троттлинга, секунды |
cgroup__memory__usage__rss / __cache |
— | gauge | RSS и page cache cgroup, байты |
cgroup__memory__limit |
— | gauge | Лимит памяти, байты (если установлен) |
cgroup__memory__dirty / __writeback |
— | gauge | Dirty/writeback-страницы, байты |
cgroup__memory__pages__in / __out |
— | counter | Заведено/выгружено страниц |
cgroup__memory__pages__major_faults |
— | counter | Major page faults |
cgroup__blkio__bytes |
operation = read | write, device |
counter | Дисковый трафик cgroup, байты |
cgroup__blkio__ops |
operation, device |
counter | Дисковые операции |
cgroup__blkio__limit__bps / __ops |
operation, device |
gauge | Лимиты пропускной способности/IOPS (если заданы) |
Docker-тома (плагин docker)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
docker__container__disk__space__used |
container, mount_point, device |
gauge | Занятое место на rw-томе контейнера, байты |
docker__container__disk__space__available |
container, mount_point, device |
gauge | Свободное место на томе, байты |
Виртуализация
Виртуальные машины (плагины qemu, vmware)
QEMU/KVM обнаруживается автоматически по процессам; VMware настраивается конфигом с адресом vCenter. Общие лейблы VM-метрик: vm_id, vm_name, hypervisor_type, hypervisor_host; для KubeVirt — namespace, pod.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
vm_info |
state, guest_os |
gauge | =1; идентификация ВМ |
vm_nic_info |
mac, model, netdev |
gauge | =1; одна серия на сетевой интерфейс ВМ |
vm_disk_size_bytes |
drive, file, format, bus, device, device_name |
gauge | Размер виртуального диска, байты |
vm_allocated_vcpu |
— | gauge | Выделено vCPU |
vm_allocated_mem_bytes |
— | gauge | Выделено памяти, байты |
vm_cpu_seconds_total |
mode = user | system |
counter | CPU-время процесса QEMU, секунды |
vm_rss_bytes |
— | gauge | RSS процесса QEMU, байты |
vm_net_rx_bytes_total / vm_net_tx_bytes_total |
— | counter | Сетевой трафик ВМ, байты |
vm_blk_read_bytes_total / vm_blk_write_bytes_total |
device |
counter | Дисковый трафик ВМ, байты |
qemu_host_kvm_module_loaded |
— | gauge | 1 — модуль KVM загружен (host-метрика) |
qemu_host_libvirt_socket_present |
— | gauge | 1 — сокет libvirt существует |
qemu_host_vm_count |
— | gauge | Число QEMU-процессов на хосте |
VMware (реалтайм-счётчики vCenter):
| Метрика | Тип | Описание |
|---|---|---|
vm_vmware_cpu_usage_percent |
gauge | Загрузка CPU ВМ, 0–100 % |
vm_vmware_memory_active_bytes |
gauge | Активная память гостя, байты |
vm_vmware_memory_consumed_bytes |
gauge | Память хоста, потреблённая ВМ |
vm_vmware_net_rx_rate_bps / _tx_rate_bps |
gauge | Сетевой трафик, байт/с |
vm_vmware_disk_read_rate_bps / _write_rate_bps |
gauge | Дисковый трафик, байт/с |
vm_vmware_esxi_info |
gauge | =1; ESXi-хост (лейблы host_name, vendor, model, cpu_model, connection_state, maintenance) |
vm_vmware_esxi_cpu_cores |
gauge | Физические ядра хоста |
vm_vmware_esxi_cpu_usage_percent |
gauge | Загрузка CPU хоста, % |
vm_vmware_esxi_memory_total_bytes / _usage_bytes |
gauge | Память хоста: всего/используется |
СУБД и кэши
Все плагины этого раздела автообнаруживаемые: агент находит процесс СУБД и подключается сам. При проблемах доступа публикуется plugin__status с инструкцией.
PostgreSQL (плагин postgresql)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
postgresql__db__size |
database |
gauge | Размер базы, байты |
postgresql__db__commits / __rollbacks |
database |
counter | Коммиты и роллбэки транзакций |
postgresql__db__deadlocks |
database |
counter | Дедлоки |
postgresql__db__tmp_bytes |
database |
counter | Записано во временные файлы, байты |
postgresql__db__max_transaction_age |
database |
gauge | Возраст старейшей транзакции (XID), только primary |
postgresql__db__transactions_left_before_shutdown |
database |
gauge | Запас XID до аварийной остановки (wraparound) |
postgresql__locks__count |
database, mode |
gauge | Число блокировок по режимам |
postgresql__connections__count |
user, database, state, client_addr |
gauge | Сессии по состояниям (active, idle, idle in transaction, waiting, …) |
postgresql__connections__max_transaction_age |
user, database |
gauge | Максимальный возраст открытой транзакции, секунды |
postgresql__autovacuum_workers__common / __wraparound |
— | gauge | Число воркеров autovacuum (обычных и anti-wraparound) |
postgresql__bgwriter__buffers_clean / __buffers_backend / __buffers_alloc / __maxwritten_clean / __buffers_backend_fsync |
— | counter | Статистика bgwriter (на PostgreSQL 17 — из pg_stat_io) |
postgresql__bgwriter__checkpoints_timed / __checkpoints_req |
— | counter | Чекпойнты по расписанию/по требованию |
postgresql__bgwriter__checkpoints_write_time / __checkpoints_sync_time |
— | counter | Время записи/синхронизации чекпойнтов, секунды |
postgresql__bgwriter__buffers_checkpoint |
— | counter | Буферы, записанные чекпойнтами |
postgresql__checkpointer__timed / __req / __write_time / __sync_time / __buffers_written |
— | counter | Те же значения под новыми именами (PostgreSQL 17 pg_stat_checkpointer) |
postgresql__replication__role |
— | text | master или slave |
postgresql__replication__wal__current_xlog_location, postgresql__replication__wal__location__current_lsn |
— | gauge | Текущая позиция WAL (primary) |
postgresql__replication__wal__last_xlog_receive_location, …__location__receive_lsn |
— | gauge | Полученная позиция WAL (standby) |
postgresql__replication__wal__last_xlog_replay_location, …__location__replay_lsn |
— | gauge | Применённая позиция WAL (standby) |
postgresql__replication__lag__seconds |
— | gauge | Отставание реплики по времени, секунды |
postgresql__replication__wal__replay__paused |
— | gauge | 1 — воспроизведение WAL приостановлено |
postgresql__replication__lag__bytes |
slave_ip, application_name |
gauge | Отставание реплики в байтах WAL (со стороны primary) |
postgresql__replication__session_age |
standby_ip, application_name |
gauge | Возраст сессии репликации, секунды |
postgresql__replication__phases__lag__bytes |
standby_ip, application_name, phase |
gauge | Отставание по фазам: sending_to_standby, writing_standby_wal, flushing_standby_wal, replaying_standby_wal |
postgresql__replication__phases__lag__seconds |
те же | gauge | Отставание по фазам во времени (PostgreSQL ≥ 10) |
postgresql__replication__slots__retained_wal__bytes |
slot_name, slot_type, database |
gauge | WAL, удерживаемый слотом репликации |
postgresql__wal_archiver__success__count / __fail__count |
— | counter | Успешные/неудачные архивации WAL |
postgresql__wal_archiver__last_success__age |
— | gauge | Секунд с последней успешной архивации |
postgresql__wal_archiver__unarchived_files__count / __bytes |
— | gauge | Неархивированные сегменты WAL: число и объём |
postgresql__wal__size__bytes / postgresql__wal__files__count |
— | gauge | Размер и число WAL-файлов на диске |
Статистика запросов (pg_stat_statements, топ-50 запросов + агрегат ~other; лейблы database, user, query) — все rate:
postgresql__query__calls, postgresql__query__rows, postgresql__query__time__total, postgresql__query__time__cpu, postgresql__query__time__disk_read, postgresql__query__time__disk_write, postgresql__query__blocks__hit, postgresql__query__blocks__read, postgresql__query__blocks__written, postgresql__query__blocks__dirtied, postgresql__query__temp_blocks__read, postgresql__query__temp_blocks__written.
Статистика таблиц (топ по каждой базе; лейблы database, schema, table) — счётчики публикуются с суффиксом __rate (rate): postgresql__table__seq_scan__rate, …__idx_scan__rate, …__seq_tuple_read__rate, …__idx_tuple_fetch__rate, …__inserted__rate, …__updated__rate, …__deleted__rate, …__autovacuum_count__rate, …__heap_blks_read__rate, …__heap_blks_hit__rate, …__idx_blks_read__rate, …__idx_blks_hit__rate, …__toast_blks_read__rate, …__toast_blks_hit__rate, …__tidx_blks_read__rate, …__tidx_blks_hit__rate; размеры — gauge: postgresql__table__table_size, postgresql__table__indexes_size.
Настройки — семейство postgresql__settings__<имя параметра>: числовые параметры (например postgresql__settings__max_connections, …__shared_buffers, …__autovacuum_max_workers) — gauge, строковые (например …__wal_level, …__archive_mode, …__data_directory) — text. Публикуются все распознанные параметры pg_settings (~300).
Статусные метрики: plugin__status (подключение), plugin__status__pg_database, …__pg_settings, …__pg_stat_activity, …__pg_stat_replication, …__pg_stat_statements — текст описывает недостающие права или отсутствие расширения.
PgBouncer (плагин pgbouncer)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
pgbouncer__total_requests, pgbouncer__total_query_count |
database |
counter | Обработанные запросы |
pgbouncer__total_received / __total_sent |
database |
counter | Трафик, байты |
pgbouncer__total_query_time / __total_xact_time / __total_wait_time |
database |
counter | Суммарное время запросов/транзакций/ожидания, секунды |
pgbouncer__total_xact_count |
database |
counter | Транзакции |
pgbouncer__databases__pool_size / __reserve_pool / __max_connections |
database, upstream_addr |
gauge | Настройки пулов |
pgbouncer__databases__paused / __disabled |
database, upstream_addr |
gauge | 0/1 — база на паузе/отключена |
pgbouncer__databases__upstream_addr |
database |
text | Адрес upstream-сервера |
pgbouncer__pools__limits__pool_size / __reserve_pool |
database, user, upstream_addr |
gauge | Лимиты активных пулов |
pgbouncer__server_connections__max / __avg |
database, user, state, upstream_addr |
gauge | Серверные соединения по состояниям (active, idle, login, tested, used) |
pgbouncer__server_connection_maxwait__max |
database, user, upstream_addr |
gauge | Максимальное ожидание серверного соединения, секунды |
pgbouncer__clients__count |
database, user, state, client_address |
gauge | Клиентские соединения по состояниям |
pgbouncer__clients__wait__max / __sum |
database, user, client_address |
gauge | Ожидание клиентов, секунды |
pgbouncer__config__<параметр> |
— | gauge | Числовые параметры из SHOW CONFIG (например pgbouncer__config__max_client_conn) |
plugin__status |
— | status | Статус подключения |
MySQL / MariaDB (плагин mysql)
Значения SHOW GLOBAL STATUS / SHOW VARIABLES (counter, если исходная переменная накопительная):
| Семейство | Метрики |
|---|---|
| Соединения | mysql__connection__max_connections, mysql__connections__aborted_clients, …__aborted_connects, …__connections, mysql__connection__connections_by_state (gauge, лейбл state) |
| Трафик | mysql__traffic__bytes_received, …__bytes_sent |
| Команды | mysql__commands__{select,insert,update,delete,replace,insert_select,replace_select,multi_update,multi_delete,call_procedure} |
| Prepared statements | mysql__prepared_commands__{prepare,execute,dealloc} |
| Транзакции | mysql__transaction_commands__{begin,commit,rollback} |
| Handler API | mysql__handler__{commit,delete,read_first,read_key,read_next,read_prev,read_rnd,read_rnd_next,rollback,savepoint,savepoint_rollback,update,write,prepare} |
| InnoDB buffer pool | mysql__innodb__buffer_pool__usage__{data,dirty,free,misc}, mysql__innodb__buffer_pool__operations__{flushed,read_ahead,read_ahead_evicted,read_ahead_rnd,read_ahead_seq,read_requests,reads_from_disk,wait_free,write_requests}, mysql__innodb__buffer_pool__activity__{pages_created,pages_read,pages_written} |
| InnoDB I/O | mysql__innodb__io__{read_bytes,written_bytes,reads_count,writes_count}, mysql__innodb__{fsyncs,current_pending_fsyncs,current_pending_reads,current_pending_writes}, mysql__innodb__doublewrite__{pages_written,writes_count} |
| InnoDB log | mysql__innodb__log__{waits,write_requests,physical_writes,fsyncs,pending_fsyncs,pending_writes,written_bytes} |
| InnoDB rows/locks | mysql__innodb__rows__{inserted,updated,deletes,read}, mysql__innodb__row_lock__{current_waits,total_time,waits}, mysql__innodb__page_size |
| MyISAM | mysql__myisam__key_cache__{blocks_not_flushed,blocks_unused,blocks_used,reads_requests,reads_from_disk,write_requests,writes_to_disk} |
| Query cache | mysql__query_cache__{free_blocks,total_blocks,hits,inserts,lowmem_prunes,not_cached,queries_in_cache} |
| Temp/sort/select | mysql__tmp__created_{disk_tables,files,tables}, mysql__sort__{merge_passes,range,sorted_rows,scan}, mysql__select__{full_join,full_range_join,range,range_check,scan} |
| Delayed | mysql__delayed__{errors,insert_threads,rows_written,not_flushed_rows} |
| Прочее | mysql__queries_count, mysql__questions_count, mysql__slow_queries, mysql__current_open_files, mysql__current_open_tables, mysql__opened_tables, mysql__locks__{immediate,waited}, mysql__threads__{cached,connected,created,running}, mysql__uptime, mysql__version (text) |
| Galera/wsrep | mysql__wsrep__local_recv_queue__avg, …__local_send_queue__avg, …__flow_control__{received,sent}, …__open_connections, …__open_transactions, …__writesets__received__{count,bytes}, …__writesets__sent__{count,bytes} |
Прочие метрики:
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
mysql__connections__max_transaction_age |
user, database |
gauge | Максимальный возраст открытой InnoDB-транзакции, секунды |
mysql_gather_error |
source, reason, mysql_error_code |
gauge | =1 при ошибке сбора части данных |
mysql__replication__slave_io_running / __slave_sql_running |
master_host, channel_name |
gauge | 0/1 — состояние потоков репликации |
mysql__replication__seconds_behind_master |
те же | gauge | Отставание реплики, секунды |
plugin__status |
— | status | Статус подключения |
Статистика запросов (performance schema, топ-50; лейблы database, query) — все rate: mysql__query__calls__rate, mysql__query__total_time__rate, mysql__query__time__lock_wait__rate, mysql__query__rows__sent__rate, mysql__query__rows__examined__rate, mysql__query__rows__sorted__rate, mysql__query__tmp_tables_created__rate (+ лейбл table_type = disk | in-memory), mysql__query__full_join__rate, mysql__query__range_check__rate, mysql__query__full_scan__rate, mysql__query__sort__merge__rate.
MongoDB (плагин mongo)
Метрики собираются пассивным анализом трафика (сниффер); топ-50 запросов. Общие лейблы: query, query_type, db, collection.
| Метрика | Тип | Описание |
|---|---|---|
mongo__query__calls__rate |
rate | Запросов в секунду |
mongo__query__total_time__rate |
rate | Суммарное время запросов, секунд в секунду |
mongo__query__traffic__in / __out |
rate | Трафик запросов/ответов, байт/с |
mongo__query__times__mean / __min / __max |
gauge | Средняя/мин/макс задержка, секунды |
mongo__query__times__percentile |
gauge | Перцентили задержки (лейбл percentile = 50 | 95 | 99) |
Redis (плагин redis)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
redis__version |
— | text | Версия Redis |
redis__uptime |
— | gauge | Аптайм, секунды |
redis__memory__used / __rss / __lua |
— | gauge | Память: allocated/RSS/Lua, байты |
redis__maxmemory |
— | gauge | Лимит памяти, байты |
redis__cpu__user / __system |
process = server | children |
counter | CPU-время, секунды |
redis__clients__connected / __blocked |
— | gauge | Подключённые/заблокированные клиенты |
redis__clients__connections_received |
— | counter | Принятые соединения |
redis__connections__rejected |
— | counter | Отклонённые соединения |
redis__commands__total_calls |
— | counter | Всего выполнено команд |
redis__commands__calls / __seconds |
command |
counter | Вызовы и суммарное время по командам |
redis__cache__evicted_keys |
— | counter | Вытеснено ключей |
redis__keys__hits / __misses |
— | counter | Попадания/промахи по ключам |
redis__db__keys / __expires |
db |
gauge | Ключей в базе / с TTL |
redis__pubsub__channels / __patterns |
— | gauge | Каналы и шаблоны pub/sub |
redis__persistence__rdb__changes_since_last_save |
— | gauge | Изменений с последнего сохранения RDB |
redis__persistence__rdb__time_since_last_save |
— | gauge | Секунд с последнего сохранения |
redis__persistence__rdb__loading_in_progress / __bgsave_in_progress |
— | gauge | 0/1 — идёт загрузка/сохранение |
redis__persistence__aof__enabled / __rewrite_in_progress |
— | gauge | 0/1 — AOF включён/идёт rewrite |
redis__persistence__aof__current_size / __buffer_length |
— | gauge | Размер AOF и буфера, байты |
redis__persistence__aof__pending_bio_fsync / __delayed_fsync |
— | gauge | Отложенные fsync |
redis__replication__connected_slaves |
— | gauge | Подключённые реплики (на мастере) |
redis__replication__last_io_seconds_ago |
— | gauge | Секунд с последнего обмена с мастером (на реплике) |
redis__replication__sync_in_progress / __sync_left_bytes / __link_down_since_seconds |
— | gauge | Состояние синхронизации с мастером |
Memcached (плагин memcached)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
memcached__version |
— | text | Версия |
memcached__uptime |
— | gauge | Аптайм, секунды |
memcached__cpu__user / __system |
— | counter | CPU-время (rusage), секунды |
memcached__items__current / __total |
— | gauge/counter | Объектов в кэше сейчас / всего сохранено |
memcached__bytes__used / __max / __malloced |
— | gauge | Занято/лимит/аллоцировано, байты |
memcached__connections__current / __total |
— | gauge/counter | Соединения |
memcached__evictions / __reclaimed |
— | counter | Вытеснения/переиспользования записей |
memcached__expired_unfetched / __evicted_unfetched / __crawler_reclaimed / __lrutail_reflocked |
— | counter | Детализация вытеснений LRU |
memcached__traffic__in / __out |
— | counter | Трафик, байты |
memcached__threads |
— | gauge | Потоки |
memcached__command__requests / __hits / __misses / __badval |
command (get, set, cas, …) |
counter | Статистика по командам |
memcached__slab__chunk_size |
chunk_size |
gauge | Размер чанка slab-класса |
memcached__slab__chunks__free / __used |
chunk_size |
gauge | Свободные/занятые чанки |
memcached__slab__bytes__free / __used |
chunk_size |
gauge | То же в байтах |
Elasticsearch (плагин elasticsearch)
Общий лейбл всех метрик — cluster. Кластерные метрики публикует только master-нода.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
elasticsearch__version |
— | text | Версия |
elasticsearch__cluster__status |
— | status | Здоровье кластера: green — значение 1, иначе 0 + текст статуса |
elasticsearch__index__settings |
index, setting = number_of_replicas | number_of_shards |
gauge | Настройки индексов |
elasticsearch__shards__count |
index, shard_type = primary | replica, shard_state = active | initializing | relocating | unassigned |
gauge | Шарды по типу и состоянию |
elasticsearch__index__size |
index |
gauge | Размер индекса, байты (топ-50 индексов) |
elasticsearch__index__docs__count / __deleted |
index |
gauge | Документы: всего / помечено удалёнными |
elasticsearch__index__segments__count / __size |
index |
gauge | Сегменты Lucene: число и память |
elasticsearch__index__operations__count__rate / __time__rate |
index, operation = get | query | fetch | scroll | merge | index | delete | flush | refresh | warmer | … |
rate | Операции индекса: частота и затраченное время |
elasticsearch__index__cache__size / __objects |
index, cache_type = query | fielddata | request |
gauge | Кэши индекса |
elasticsearch__index__cache__hits__rate / __misses__rate / __evictions__rate / __caches__rate |
index, cache_type |
rate | Активность кэшей |
elasticsearch__index__translog__size / __operations__rate |
index |
gauge/rate | Translog |
elasticsearch__http__current_open__rate |
— | rate | Открытия HTTP-соединений |
elasticsearch__transport__rx_count__rate / __rx_bytes__rate / __tx_count__rate / __tx_bytes__rate |
— | rate | Межнодовый трафик |
elasticsearch__script__compilations__rate / __cache_evictions__rate |
— | rate | Компиляции скриптов |
elasticsearch__thread_pool__threads / __queue / __active |
thread_pool |
gauge | Пулы потоков |
elasticsearch__thread_pool__rejected__rate / __completed__rate |
thread_pool |
rate | Отклонённые/выполненные задачи |
elasticsearch__breaker__limit / __estimated |
breaker |
gauge | Circuit breakers: лимит и оценка, байты |
elasticsearch__breaker__overhead |
breaker |
gauge | Коэффициент overhead |
elasticsearch__breaker__tripped__rate |
breaker |
rate | Срабатывания breaker |
Очереди, брокеры, поиск
RabbitMQ (плагин rabbitmq)
Через Management API; топ-50 очередей. Лейблы: vhost, queue.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
rabbitmq__queue__messages |
— | gauge | Сообщений в очереди |
rabbitmq__queue__memory |
— | gauge | Память очереди, байты |
rabbitmq__queue__published__rate |
— | rate | Скорость публикации, сообщений/с |
rabbitmq__queue__delivered__rate |
ack = manual_ack | auto_ack |
rate | Скорость доставки потребителям |
plugin__status |
— | status | Ошибки: management-плагин выключен, нет прав и т.п. |
Kafka (плагин kafka)
Лейблы уровня экземпляра: broker_id, cluster_id. Метрики партиций публикует брокер-лидер партиции.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
kafka__version |
— | text | Версия Kafka |
kafka__brokers__count |
— | gauge | Число брокеров в кластере |
kafka__topic__partition__count |
topic |
gauge | Число партиций топика |
kafka__topic__partition__size |
topic, partition |
gauge | Размер партиции на диске, байты |
kafka__topic__partition__offset__newest / __oldest |
topic, partition |
gauge | Крайние офсеты партиции |
kafka__topic__partition__replication__isr_count |
topic, partition |
gauge | Число in-sync реплик |
kafka__topic__partition__replication__replicas_count |
topic, partition |
gauge | Число реплик |
kafka__consumer_group__status |
group |
status | Состояние группы: пусто — stable, иначе текст (preparingrebalance, …) |
kafka__consumer_group__members__count |
group |
gauge | Участники группы |
kafka__consumer_group__protocol / __protocol_type |
group |
text | Протокол группы |
kafka__consumer_group__topic__partition__offset__committed |
topic, partition, group, member_host, member_id |
gauge | Закоммиченный офсет группы (лаг = newest − committed) |
ZooKeeper (плагин zookeeper)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
zookeeper__status |
— | status | Пусто — ОК; zookeeper cluster is down / zookeeper node in standalone mode |
plugin__status |
— | status | Текст please add commands in whitelist, если 4-буквенные команды stat/mntr запрещены |
zookeeper__version |
— | text | Версия |
zookeeper__role |
— | text | Роль ноды (leader, follower) |
zookeeper__nodes__current / __expected |
— | gauge | Нод в ансамбле: фактически / по конфигу |
zookeeper__znodes__regular / __ephemerals |
— | gauge | Число znode: обычных / эфемерных |
zookeeper__watchers |
— | gauge | Число watcher’ов |
zookeeper__leader_elections |
— | gauge | Номер эпохи (число выборов лидера) |
zookeeper__current_transaction_number__<role> |
— | gauge | Счётчик транзакций из zxid (<role> — режим ноды) |
zookeeper__client_latency__min / __avg / __max |
— | gauge | Задержка клиентских запросов, секунды |
zookeeper__packets__received / __sent |
— | counter | Пакеты |
zookeeper__outstanding_requests |
— | gauge | Запросы в обработке |
zookeeper__outstanding_requests__limit |
— | gauge | Лимит (globalOutstandingLimit) |
zookeeper__connection__packets__queued / __received / __sent |
client_ip |
rate | Активность по клиентским соединениям |
Sphinx (плагин sphinx)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
sphinx__uptime |
— | gauge | Аптайм searchd |
sphinx__connections__count / __overflows |
— | counter | Соединения / отказы maxed_out |
sphinx__agent__connections / __retries |
— | counter | Соединения с агентами распределённого поиска |
sphinx__query__count |
query_type = local | distributed |
counter | Запросы |
sphinx__query__total_time |
query_type |
counter | Суммарное время запросов |
sphinx__query__time |
query_type, stage = cpu | local | wait | disk_read |
counter | Время по стадиям |
sphinx__query__disk__ops__read / sphinx__query__disk__bytes__read |
query_type="local" |
counter | Чтения с диска |
sphinx__command__calls |
command |
counter | Вызовы по типам команд (search, update, …) |
sphinx__index__documents__count / __bytes |
index, index_type |
gauge | Документы в индексе: число и объём |
sphinx__index__memory__used / __limit |
index, index_type |
gauge | Память индекса |
sphinx__index__disk__used |
index, index_type |
gauge | Диск, занятый индексом |
Resque (плагин resque, по конфигу)
Требует YAML-конфиг с redis_address и prefix.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
resque__tasks__pending |
queue |
gauge | Задач в очереди |
resque__tasks__processed |
worker, queue |
rate | Обработано задач/с |
resque__tasks__failed |
worker, queue |
rate | Ошибок/с |
Веб-серверы и прокси
Nginx (плагин nginx)
Метрики строятся парсингом access-логов (формат определяется автоматически из конфига nginx) и проверкой TLS-сертификатов из конфига. Общие лейблы лог-метрик: file (путь лога), log_format.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
nginx__requests__rate |
method, status, cache_status, url |
rate | Запросов/с; url — топ-N URL с нормализацией, остальное — ~other |
nginx__traffic__rate |
url |
rate | Отдано байт/с |
nginx__response_time__percentiles |
percentile = 50 | 75 | 95 | 99 |
gauge | Перцентили времени ответа, секунды |
nginx__response_time__histogram |
method, cache_status, url, levels, level |
rate | Гистограмма времени ответа (бакеты по умолчанию 0.5 и 1 с) |
nginx__upstream_response_time__percentiles |
percentile |
gauge | Перцентили времени ответа upstream |
nginx__upstream_response_time__histogram |
как у histogram | rate | Гистограмма времени ответа upstream |
nginx__ssl_certificate__seconds_to_expire |
certificate_file |
gauge | Секунд до истечения сертификата |
nginx__ssl_certificate__revoke_status |
certificate_file |
gauge | OCSP: 1 — good, 0 — revoked |
nginx__ssl_certificate__check_status |
certificate_file |
status | Ошибка чтения/парсинга сертификата |
status |
access_log или log_format |
status | Проблемы конфигурации: недоступный лог, неразобранный log_format |
PHP-FPM (плагин php_fpm)
Через страницу статуса FCGI (pm.status_path). Общий лейбл — pool.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
php_fpm__pool__uptime |
— | gauge | Аптайм пула, секунды |
php_fpm__pool__accepted_connections |
— | counter | Принятые соединения |
php_fpm__pool__listen_queue__current / __limit |
— | gauge | Очередь запросов: текущая/лимит |
php_fpm__pool__processes__count |
state = active | idle |
gauge | Воркеры по состояниям |
php_fpm__pool__processes__limit_reached |
— | counter | Сколько раз достигался max_children |
plugin__status / status |
pool |
status | Статус-страница выключена / ошибка подключения |
Envoy (плагин envoy)
Прозрачный проброс метрик admin-интерфейса Envoy (/stats?format=prometheus): имена и лейблы передаются как есть (например envoy_cluster_upstream_rq_total, envoy_server_live). Передаются только counter и gauge; гистограммы пропускаются.
JVM и Cassandra
JVM (плагин jvm)
Для каждого Java-процесса с включённым JMX (без аутентификации). Лейблы уровня экземпляра: jvm, user.
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
jvm__memory__heap__used / __max |
— | gauge | Heap: используется/максимум, байты |
jvm__memory__nonheap__used / __max |
— | gauge | Non-heap память |
jvm__memory__pool__used / __max |
pool |
gauge | Пулы памяти (Eden, Old Gen, Metaspace, …) |
jvm__gc__counter |
collector |
counter | Сборки мусора по коллекторам |
jvm__gc__total_time |
collector |
counter | Время GC, секунды |
jvm__threads__current / __daemon |
— | gauge | Живые/daemon-потоки |
jvm__threads__created |
— | counter | Всего создано потоков |
jvm__uptime |
— | gauge | Аптайм JVM, миллисекунды |
status |
— | status | JMX disabled, please enable it / JMX authentication enabled, please disable it и т.п. |
Cassandra (ветка плагина jvm, публикуется как plugin=cassandra)
Дополнительные лейблы: cluster, datacenter, rack.
| Семейство | Метрики | Лейблы |
|---|---|---|
| Версия | cassandra__version (text) |
— |
| Кэши | cassandra__row_cache__{max_bytes,used_bytes,hits,requests,entries}, cassandra__key_cache__{…}, cassandra__counter_cache__{…} |
— |
| Клиентские запросы | cassandra__client_requests__{count,unavailables,timeouts,failures,total_seconds} |
operation (Read/Write/…), опц. consistency_level |
| Commit log | cassandra__commitlog__{waiting_on_segment_allocation,pending_tasks,waiting_on_commit,completed_tasks,total_size} |
— |
| Компакции | cassandra__compaction__{completed_tasks,bytes_compacted,completed_compactions,pending_tasks} |
— |
| Storage | cassandra__storage__{bytes_used,exceptions_count,hints_count,hints_in_progress} |
— |
| CQL | cassandra__cql__prepared_statements__{executed,count,evicted}, cassandra__cql__regular_statements__executed |
— |
| Read repair | cassandra__read_repair__{attempted,blocking,background} |
— |
| Межнодовое взаимодействие | cassandra__nodes__{messages_received,messages_sent,pending_responses,pending_requests,messages_dropped,timeouts} |
node, для dropped опц. type = large | small |
| Отброшенные сообщения | cassandra__dropped_messages__count |
message_type |
| Таблицы | cassandra__table__{waiting_on_memtable_free,disk_space_used,sstables_count,pending_flushes,snapshots_size,compression_ratio,pending_compactions,speculative_retries,mean_row_size,min_row_size,max_row_size}, cassandra__table__row_cache__{hit,miss,hit_out_of_range}, cassandra__table__ops__{count,total_time} (+operation), cassandra__memtable__{size__heap,size__off_heap,switch_count,columns_count}, cassandra__bloom_filter__{false_positives,disk_space_used} |
keyspace, table |
Почта
Почтовые серверы (плагин mail)
Автообнаружение Exim и Postfix. Метрики очередей — прямой опрос; метрики потока писем — парсинг логов. Общий лейбл — mta = exim | postfix; у лог-метрик дополнительно file.
| Метрика | Доп. лейблы | Тип | Описание |
|---|---|---|---|
mail__queue__size |
queue (для postfix: maildrop, hold, incoming, active, deferred; для exim: main) |
gauge | Сообщений в очереди |
mail__messages__received |
— | rate | Принято писем/с |
mail__messages__delivered |
postfix: recipient_domain |
rate | Доставлено писем/с |
mail__messages__deferred |
— | rate | Отложено/с |
mail__messages__failed |
— | rate | Провалено (bounce)/с |
mail__delivery_errors |
response_code (SMTP 4xx/5xx) |
rate | Ошибки доставки по кодам |
mail__delivery_time__histogram |
recipient_domain, levels, level |
rate | Гистограмма времени доставки Postfix (бакеты 5 с/1 мин/5 мин/30 мин) |
status |
— | status | Ошибка инициализации парсера логов Exim |
Плагин syslog собственных метрик не публикует — он находит лог-файлы для Postfix.
Безопасность
Права файлов (плагин security_file_permissions)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
security_file_permissions |
file_path, mode |
gauge | Существование (0/1) и режим доступа критичных файлов: /etc/passwd, /etc/shadow, /etc/group, /etc/gshadow, /etc/hosts, /etc/fstab и др. |
security_file_permissions_errors_total |
— | gauge | Число файлов, для которых проверка завершилась ошибкой |
Пользовательские метрики
Плагины этого раздела публикуют метрики с именами, которые задаёт пользователь или которые выводятся из данных. Настраиваются YAML-файлами в config.d/.
StatsD (плагин statsd)
Встроенный StatsD-сервер (UDP). Имя метрики берётся из StatsD-пакета; части имени вида key=value или key_is_value извлекаются в лейблы. Значения лейблов, начинающиеся с /, нормализуются как URL-пути; password заменяется на ~hidden.
| Тип StatsD | Публикуемые метрики |
|---|---|
gauge (g) |
<имя> — gauge |
counter (c, m) |
<имя>__rate — rate (события/с) |
timer (ms, h) |
<имя>__lower, <имя>__upper (мин/макс), <имя>__rate (событий/с), <имя>__sum (сумма/с), <имя>__mean (среднее), <имя>__percentile с лейблом percentile = 50 | 75 | 90 | 95 | 97 | 99; значения в секундах |
set (s) |
не поддерживается |
Logparser (плагин logparser)
Превращает строки логов в метрики по конфигу: regex + список metrics с типами rate, threshold (гистограмма), percentiles, max, min. Имя метрики — поле name из конфига (как есть, точки → __). Лейблы — из конфига; поддерживаются выражения, top-N переменные (redкие значения → ~other) и разбор User-Agent. На все метрики добавляется лейбл file.
| Метрика | Тип | Описание |
|---|---|---|
<имя из конфига> |
rate/gauge | Пользовательская метрика; для threshold добавляются лейблы levels, level; для percentiles — percentile |
logparser__lines__succeeded |
rate | Успешно разобранных строк/с |
logparser__lines__unmatched |
rate | Строк, не подошедших под regex |
logparser__lines__failed |
rate | Строк с ошибкой разбора значений |
SQL-запросы (плагины mysql_query, postgresql_query, mssql_query, clickhouse_query)
Выполняет SQL из конфига. Имя метрики — поле metric_name. Колонка результата value — значение; остальные колонки становятся лейблами.
| Метрика | Тип | Описание |
|---|---|---|
<metric_name> |
gauge | Значения строк результата |
status |
status | Ошибка подключения/запроса или ОК |
Redis-запросы (плагин redis_query)
Выполняет команды Redis из конфига. Имя метрики: <ключ>__<команда> (например GET mykey → mykey__get); аргументы команды попадают в лейбл param.
Выполнение команд (плагин execute)
Запускает исполняемый файл и разбирает stdout (regex с именованными группами или JSON). Имя метрики — из конфига (name) или из поля name JSON.
| Метрика | Тип | Описание |
|---|---|---|
<имя> |
gauge/text | Значения из вывода команды |
status |
status | Код возврата/ошибка разбора |
duplicate_metric_count |
gauge | Число задублированных метрик в выводе |
HTTP-проверки (плагин http)
Выполняет HTTP-запрос; метрики извлекаются regex-группами из тела ответа (metrics[].metric в конфиге).
| Метрика | Тип | Описание |
|---|---|---|
<имя из конфига> |
gauge | Значение из тела ответа |
http__request_time |
gauge | Время выполнения запроса, секунды |
status |
status | Ошибка запроса/несоответствие ответа |
Go expvar (плагин expvar)
Читает /debug/vars Go-приложения; публикуется фиксированный набор из memstats:
go__memory__bytes__alloc, go__memory__bytes__sys, go__memory__total_alloc, go__memory__ops (лейбл operation = lookup | malloc | free), go__memory__heap__alloc, go__memory__heap__sys, go__memory__heap__bytes (лейбл state = used | idle), go__gc__count, go__gc__total_pause, go__gc__max_pause, плюс status.
Prometheus-экспортёры (плагин prometheus)
Скрейпит любой OpenMetrics/Prometheus endpoint и передаёт метрики с исходными именами и лейблами (префиксы не добавляются). Дополнительно у каждой метрики появляется лейбл metric_type (тип из exposition). Гистограммы разворачиваются в <имя>_count, <имя>_sum, <имя>_bucket (+le); summary — в <имя>_count, <имя>_sum, <имя> (+quantile). Фильтрация — metrics_white_list / metrics_black_list по префиксу имени; лимит серий на endpoint — 5000 (при превышении публикуется только plugin__status с ошибкой).
Служебные метрики: status (успешность скрейпа), plugin__status (лейбл source — файл конфига).
Служебные метрики агента
Самоконтроль (плагины heartbeat, okagent_stat)
| Метрика | Лейблы | Тип | Описание |
|---|---|---|---|
okagent_heartbeat |
— | gauge | =1; признак жизни агента |
okagent_up |
— | gauge | Аптайм процесса агента, секунды |
okagent_uuid |
— | text | UUID агента |
okagent__version |
— | text | Версия агента |
okagent__memstats__alloc / __sys / __heap__* / __stack__* / … |
— | gauge | Память Go-рантайма агента (полный набор runtime.MemStats) |
okagent__gc__time / __count |
— | counter | GC агента: суммарное время пауз и число циклов |
lock_status |
agent_random_uuid |
gauge | 0 — lock-файл захвачен нормально; 1 — агент запущен повторно; 2 — ошибка проверки |
Внутренние счётчики (через плагин okagent_stat)
Внутренние счётчики публикуются с префиксом okagent__. Основные семейства:
| Метрика | Лейблы | Описание |
|---|---|---|
okagent__agent__stale_nans, …__plugin_metrics_swapped, …__frequent_packages, …__multipackage_labelset, …__duplicate_labelset, …__plugin_instances, …__duplicate_ls, …__dns_fallback |
по счётчику | Диагностика конвейера метрик: staleness-маркеры, дубликаты, DNS-фолбэки |
okagent__metric_group__metrics_dropped |
reason = timestamp | cardinality | invalid, pname |
Отброшенные метрики: устаревший timestamp, превышение кардинальности, невалидное имя |
okagent__metric_writer__metricpacks_dropped, …__metrics_dropped, …__buffer_input_metrics, …__switch_proxy, okagent__writer__empty_labels |
writer, reason |
Транспорт: переполнение буфера, переключение на прокси |
okagent__scheduler__ticks_skipped |
obj_name, func_name |
Пропущенные тики планировщика (плагин не успел за интервал) |
okagent__process_multiplexer__pushes_skipped |
subscriber |
Пропуски раздачи списка процессов подписчикам |
okagent__statsd__packets__udp, …__errors, …__measurements, …__metrics |
type, mtype |
Диагностика StatsD-сервера |
okagent__sniffer__errors, …__skipped_packets, …__non_data_packets, …__duplicate_packets |
error, proto |
Диагностика сниффера (MongoDB) |
okagent__mongo__errors |
error |
Ошибки разбора протокола MongoDB |
okagent__pg__settings__unknown_variables / __missed_variables |
instance |
Нераспознанные/недополученные параметры pg_settings |
Внутренние метрики доставки (плагин prometheus_internal_scraper)
Публикует всё из внутреннего Prometheus-реестра агента — прежде всего метрики подсистемы доставки remote write (odarix_core_delivery_*): состояние очередей, отправка, refill, транспорт. Имена передаются как есть.
Конвенции статусных метрик
| Метрика | Описание |
|---|---|
status |
Статус экземпляра плагина (у конфигурируемых и части автообнаруживаемых) |
plugin__status |
Статус интеграции: пустой текст (значение 1) — сбор работает; текст ошибки (значение 0) — что нужно исправить |
plugin__status__invalid_names |
Появляется, если плагин сгенерировал метрики с невалидными именами (они отброшены; список — в тексте) |