Метрики компонентов Платформы

Список неспецифических метрик, которые отслеживает сервис Watchdog и записывает в индекс core-кластера performance-*.

МетрикаОписаниеТип компонентаИмя компонента

сontainer_status

состояние docker контейнера компонента. Возможные значения: created, restarting, running, paused, exited, dead, unknown

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

container_block_input

объем данных в байтах, записанных контейнером на блочные устройства хоста

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

container_block_output

объем данных в байтах, считанных контейнером на блочные устройства хоста

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

container_cpuperc

процент ЦПУ хоста, используемых контейнером

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

container_memperc

процент памяти хоста, используемых контейнером

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

container_memusage

общий объем памяти, который использует контейнер

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

container_pids

количество процессов или потоков, созданных контейнером

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

api_status 

проверка, что компонент запущен и отвечает по API

core

console, dashboards, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

cluster-node

<имя узла>

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

errors_count

количество ошибок в журнале приложения компонента

core

console, dashboards, database, frontend, broker

service

gateway, census, ioc-watcher, reporter, signal, ueba, watchdog

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

grabber

wec

cluster-node

<имя узла>

eps

количество поступающих на ресивер событий в секунду

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

active_sources

количество уникальных хостов (по host.name), от которых были события на последние 7 дней

 

 

process_cpu_percent

процент потребления ЦПУ ресивером

 

 

process_cpu_load_average_1m

среднее потребление процессора за 1 минуту от количества поступающих от источников событий

 

 

process_cpu_load_average_5m

среднее потребление процессора за 5 минут от количества поступающих от источников событий

 

 

process_cpu_load_average_15m

среднее потребление процессора за 15 минут от количества поступающих от источников событий

 

 

reloads_failures

количество отказов при перезагрузке (количество неудачных попыток перезагрузки)

 

 

jvm_mem_heap_committed_in_bytes

объем памяти в байтах, доступный для использования кучей

 

jvm_mem_heap_max_in_bytes

максимальный объем памяти в байтах, доступный для использования кучей

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

cluster-node

<имя узла>

jvm_mem_heap_used_in_bytes

объем памяти в байтах, используемая в данный момент кучей

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

cluster-node

<имя узла>

jvm_mem_heap_used_percent

процент памяти, используемой в данный момент кучей

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

cluster-node

<имя узла>

jvm_uptime_in_millis

время работы jvm (Java Virtual Machine) в миллисекундах

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

cluster-node

<имя узла>

jvm_mem_non_heap_committed_in_bytes

объем доступной памяти без кучи в байтах

receiver

wec, jdbc, syslog, beats, netflow, snmp, custom

jvm_mem_non_heap_used_in_bytes

объем используемой памяти без кучи в байтах

 

 

os_available_processors

количество доступных процессоров

 

 

events_filtered

количество событий, прошедших через фильтры

 

 

events_in

события, принятый ресивером

 

 

events_out

события, отправленные ресивером во Opensearch и другие системы

 

 

events_queue_push_duration_in_millis

время ожидания событий в очереди ресивера в миллисекундах

 

 

events_duration_in_millis

время обработки событий в ресивере в миллисекундах

 

free_in_bytes

общее количество нераспределенных байт в кластере

cluster

<имя кластера>

total_in_bytes

общий размер всех файловых хранилищ в байтах в кластере

 

 

cluster_name

имя кластера

 

 

status

текущий статус кластера. Возможные значения: green, yellow, red

 

 

timed_out

булевое значение. Если false, то ответ возвращается в течение периода времени, заданного параметром timeout (по умолчанию 30 с)

 

 

number_of_nodes

количество узлов в кластере

 

 

number_of_data_nodes

количество узлов, являющихся выделенными узлами данных

 

 

active_primary_shards

количество активных первичных шардов

 

 

active_shards

общее количество активных первичных и реплик шардов

 

 

relocating_shards

количество перемещенных шардов

 

 

initializing_shards

количество шардов, находящихся в стадии инициализации

 

 

unassigned_shards

количество нераспределенных шардов

 

 

delayed_unassigned_shards

количество отложенных шардов

 

 

number_of_pending_tasks

количество изменений на уровне кластера, которые еще не были выполнены

 

 

number_of_in_flight_fetch

количество незавершенных операций

 

 

task_max_waiting_in_queue_millis

время в миллисекундах, прошедшее с момента ожидания выполнения самой ранней инициированной задачи

 

 

active_shards_percent_as_number

процент активных шардов

 

 

max_shard_size

максимальный размер шарда в кластере в байтах

 

 

indices_shards_total

общее количество шардов в кластере

 

 

indices_shards_primaries

количество первичных шардов в кластере

 

 

indices_shards_replicas

количество реплик шардов в кластере

 

 

indices_docs_count

количество документов в индексах в кластере

cluster

<имя кластера>

cluster-node

<имя узла>

indices_count

количество индексов в кластере

cluster

<имя кластера>

http_current_open

количество открытых в данный момент HTTP-соединений

cluster-node

<имя узла>

http_total_opened

общее количество HTTP-соединений, открытых за все время

 

 

fs_total_free_in_bytes

общее количество нераспределенных байт во всем файловом хранилище

 

 

fs_total_total_in_bytes

общий размер всех файловых хранилищ в байтах

 

 

fs_total_available_in_bytes

общее количество байт, доступных данной jvm (Java Virtual Machine) на всех файловых хранилищах. Это фактический объем свободного дискового пространства, который может использовать узел Opensearch

 

 

indices_merges_total_size_in_bytes

общий размер объединений документов в байтах

 

 

indices_fielddata_memory_size_in_bytes

общий объем памяти в байтах, используемый для кэша полевых данных во всех шардах, назначенных узлу

 

 

indices_indexing_index_time_in_millis

общее время в миллисекундах, затраченное на выполнение операций индексирования

 

 

indices_indexing_index_total

общее количество операций индексирования

 

 

indices_indexing_index_failed

количество неудачных операций индексирования

 

 

indices_indexing_throttle_time_in_millis

общее время в миллисекундах, затраченное на операции throttling

 

 

jvm_gc_collectors_old_collection_count

количество сборщиков мусора jvm (Java Virtual Machine), собирающих объекты старого поколения

 

 

jvm_gc_collectors_old_collection_time_in_millis

общее время в миллисекундах, затраченное jvm (Java Virtual Machine) на сбор объектов старого поколения

 

 

jvm_gc_collectors_young_collection_count

количество сборщиков мусора jvm (Java Virtual Machine), собирающих объекты молодого поколения

 

 

jvm_gc_collectors_young_collection_time_in_millis

общее время в миллисекундах, затраченное jvm (Java Virtual Machine) на сбор объектов молодого поколения

 

 

jvm_mem_pools_old_used_in_bytes

объем памяти в байтах, используемой кучей старого поколения

 

 

jvm_mem_pools_survivor_used_in_bytes

объем памяти в байтах, используемой пространством survivor (оставшимся пространством для узла)

 

 

jvm_mem_pools_young_used_in_bytes

объем памяти в байтах, используемой кучей молодого поколения

 

 

thread_pool_write_active

количество активных потоков на запись в пуле потоков

 

 

thread_pool_write_completed

количество задач, выполненных исполнителем пула потоков на запись

 

 

thread_pool_write_rejected

количество задач, невыполненных исполнителем пула потоков на запись

 

 

shards_count

количество шардов на узел кластера

 

 

primary_shards_count

количество шардов по всем первичным хранилищам

 

 

replica_shards_count

количество шардов по всем репликам

 

 

cpu_load_1m

потребление ЦПУ компонентами Alertix в течение 1 минуты

system

cpu

cpu_load_5m

потребление ЦПУ компонентами Alertix в течение 5 минут

 

 

cpu_load_15m

потребление ЦПУ компонентами Alertix в течение 15 минут

 

 

availability

доступность хоста по сети

system

network

total_bytes

весь объем оперативной памяти на хосте

system

memory

весь объем памяти в байтах, который есть на диске

disk

<имя диска>

used_bytes

используемый объем оперативной памяти на хосте

system

memory

занятый на диске объем памяти в байтах

disk

<имя диска>

used_percent

процент потребления оперативной памяти на хосте

system

memory

процент занятого места на диске

disk

<имя диска>

filebeat_status

активен ли процесс filebeat’а

system

process

Список специфических метрик, которые отслеживает сервис Watchdog и записывает в индекс core-кластера performance-*.

Тип компонентаИмя компонентаМетрикаОписание

service

gateway

<integration>_enabled

включена ли та или иная интеграция сервиса (например, telegram_enabled)

census

hosts_count

количество записей, которые есть в таблице census_hosts в PostgreSQL

resources_count

количество записей, которые есть в таблице resources в PostgreSQL

resources_added

количество записей, которые есть в таблице resources и у которых поле created_by ненулевое

ioc-watcher

feeds_count

количество индикаторов компрометации из потоков данных поставщиков (фидов)

feeds_active

количество активных индикаторов компрометации из потоков данных поставщиков

iocs_active

состояние источников иоков и наличие ошибок обновления базы иоков сервиса. Возвращает количество активных иоков в базе IOC-Watcher

iocs_found

количество обнаружений иоков IOC-Watcher

iocs_count

общее количество иоков в базе IOC-Watcher

signal

rules_count

количество правил

hidden_rules_count

количество скрытых правил

bad_rules_count

количество правил с ошибками

bad_rules

строка с описанием правил с ошибками

transactions_count

количество транзакций

transactions_success

количество успешных транзакций

transactions_failure

количество неуспешных транзакций

events_written

количество записанных в индексы сработок

events_not_written

количество незаписанных в индексы сработок

list_rules_count

количество правил для списков

bad_list_rules_count

количество правил для списков с ошибками

bad_list_rules

строка с описанием правил для списков с ошибками

lists_count

количество списков

duration_top

максимальная продолжительность работы запроса правила

receiver

beats

agents_count

количество агентов, подключенных к указанному ресиверу

core

broker

ping_max

максимальное время ответа

jetstream_config_max_memory

максимальная доступная память (Jetstream)

jetstream_config_max_storage

максимальное доступное место на диске (Jetstream)

jetstream_stats_memory

потребление памяти (Jetstream)

jetstream_stats_storage

потребление места на диске (Jetstream)

jetstream_stats_accounts

количество подключений (Jetstream)

jetstream_stats_api_total

количество обращений по API (Jetstream)

jetstream_stats_api_errors

количество обращений по API, завершившихся с ошибкой (Jetstream)

uptime

время работы

connections

количество активных подключений

total_connections

общее количество подключений

in_msgs

количество записанных сообщений

out_msgs

количество прочитанных сообщений

in_bytes

входящие данные в байтах

out_bytes

исходящие данные в байтах

subscriptions

количество подписок

Схема индекса журнала метрик performance:

НазваниеОписание

component.type

Тип компонента платформы, который записывает событие в журнал. Одно из: backend, data-cluster, receiver, service, opensearch-dashboards, postgres

component.name

Название компонента

component.ip

если применимо, то ip address хоста, на котором находится компонент

component.domain

если применимо, то fqdn хоста, на котором находится компонент

component.address

component.domain, если нет, то component.ip

name

Название (Signal bad rules, CPU 5m, Heap node-warm-1)

value

Само значение метрики (строкой)

numeric_value

Числовое значение метрики (если возможно)

time

Время получения метрики сервисом