Мониторинг инфраструктуры не заканчивается на Zabbix

Когда я спрашиваю коллег, зачем им мониторинг, почти все отвечают одинаково: «чтобы знать, когда что-то сломалось». Ответ правильный, но не полный.

Мониторинг нужен не только для того, чтобы зафиксировать аварию постфактум, а чтобы еще управлять мощностью и доступностью до того, как авария случится, а также контролировать исполнение SLA.

Стоимость отсутствия мониторинга набегает из нескольких статей, и считать их вместе почему-то никто не любит.

Самое очевидное — прямые потери от простоев. Gartner оценивает час незапланированного простоя enterprise-компании в сумму свыше $300 000 (тут придется поверить аналитикам на слово). Четыре часа, которые команда без нормального мониторинга тратит на поиск причины, — это не «издержки производства», а вполне конкретные деньги, даже если в компании никто не сможет посчитать. Для банка, ритейлера, логистики или телекома порядок цифр сопоставим и с нашими реалиями.

Дальше идут скрытые потери от деградации, и вот их недооценивают чаще всего. Приложение работает, но медленно. СУБД отвечает, но с задержками. Канал жив, но пакеты теряются. Пользователь сначала терпит, потом пишет в поддержку, а потом уходит — и уходит не потому, что «не работает», а потому, что «неудобно». Без мониторинга такая деградация спокойно живет неделями, а то и месяцами, и замечают ее обычно тогда, когда уже поздно.

А ведь еще есть составные проблемы и постепенно развивающаяся деградация, которые Zabbix не сможет вам помочь увидеть.

Есть еще риски организационные, и бьют они по людям, а не по сервисам. Когда ИТ-служба узнает о падении сервиса от клиента или, того хуже, из соцсетей — внутри компании это уже репутационная история. Доверие к ИТ-руководителю набирается годами, а может сгореть за одну аварию. Тут проактивный мониторинг работает не столько как технология, сколько как способ держать лицо: с ним ИТ-директор приходит к бизнесу с цифрами в обосновании стратегии, а не с объяснительной.

И, наконец, регуляторика. Для финансового сектора, объектов КИИ и госструктур непрерывность сервисов прописана в законе. Отсутствие документированного мониторинга — это нарушение, которое проверяющий вполне способен найти и квалифицировать как нарушение правил эксплуатации информационных систем с тяжкими последствиями (ст. 274.1 ч. 3 УК). Звучит абстрактно ровно до первой проверки.

Если свести все вместе, то мониторинг — это не расходы на ПО, а страховка от потерь, которые на порядок больше цены любой платформы. Именно с этой стороны его и стоит продавать бизнесу

Четыре уровня мониторинга для разных задач

Самая частая ошибка, которую я вижу в компаниях, — отношение к мониторингу как к чему-то однородному. «Поставили Zabbix — значит, мониторинг есть». На деле это стек из четырех уровней, и каждый отвечает на свои вопросы для своих заказчиков.

Уровень 1 — сбор данных и инфраструктурный мониторинг. Метрики хостов, сети, СУБД, агенты на серверах. Вопрос простой: «живо ли железо и софт?». Аудитория — системный администратор и сетевой инженер.

Уровень 2 — зонтичный мониторинг. Здесь данные из разных источников сводятся вместе, строится топология и единая сервисная модель, считаются SLA и OLA. Системы отвечают уже на вопрос «как состояние железа отражается на бизнес-сервисах?». Аудитория — ИТ-директор и руководители эксплуатации. Без этого уровня директор видит бесконечную ленту алертов, но не понимает, какие из них прямо сейчас бьют по ключевым бизнес-процессам, — если, конечно, сам не сидит по локоть в инфраструктуре.

Уровень 3 — AIOps и интеллектуальный анализ. ML-корреляция событий, автоматический поиск первопричины, детекция аномалий, предиктивная аналитика. Вопрос: «когда упадет, почему упало и что будет дальше?». Когда поток алертов переваливает за 3000 событий в секунду, без этого уровня команда физически тонет: люди начинают игнорировать алерты, и мониторинг, по сути, перестает быть мониторингом.

Уровень 4 — бизнес-наблюдаемость. ИТ описывается на языке бизнеса: доступность конкретного сервиса, выполнение договорных SLA, влияние сбоев на выручку. Вопрос самый верхнеуровневый: «что прямо сейчас происходит с бизнесом?». Аудитория – бизнес и топ-менеджмент.

Важно вот что: уровни наслаиваются, а не заменяют друг друга. Зонтичный мониторинг не на чем построить без источников данных с первого уровня, а бизнес-наблюдаемость не появится без сервисной модели со второго. Перепрыгнуть ступеньку не выйдет, как бы ни хотелось.

Мониторинг инфраструктуры не заканчивается на Zabbix. Рис. 1
Российский рынок: что есть и что выбывает из обзора

Читайте также
Яндекс и Т-Банк покажут, где есть бензин на АЗС
На фоне очередей на АЗС и ограничений на отпуск топлива водители ищут заправку, где он вообще имеется. Сначала эту задачу попытались решить через пользовательские карты, теперь ей занимаются крупные цифровые платформы.

После 2022 года рынок перекроило структурно. Западные вендоры сбежали - IBM Tivoli, BMC, Dynatrace, Datadog. Их место заняли российские продукты, большинство из которых попало в реестр Минцифры в 2023–2024 годах.

Прежде чем перейти к списку, обозначу, кого я в него не взял и почему. За скобки вынесены две категории:

  • Продукты, заточенные под узкий российский стек (Astra Linux, только отечественное железо). На разнородной инфраструктуре, а именно такая у большинства крупных заказчиков – они не применимы.

  • Продукты, которые проигрывают Zabbix по охвату коннекторов. Включать их в обзор - это значит создавать иллюзию выбора там, где его нет.

Остается вот что.

Zabbix + Grafana — open source-фундамент. Тысячи шаблонов, SNMP, IPMI, JMX, агенты под любые платформы и ноль рублей за лицензии. Чего нет из коробки — зонтичного мониторинга, incident management и AIOps; все это придется либо интегрировать руками, либо надстраивать сверху. Уровень 1.

Пульт (Лаборатория Числитель) — российская надстройка над Zabbix. Берет весь его охват коннекторов, добавляет шаблоны под отечественное оборудование и отдельный модуль отчетности, который, как утверждает вендор, нормально себя чувствует в крупных проектах. В реестре российского ПО. Технологически стыкуется с Monq и Artimate. Уровень 1.

wiSLA (Wellink) — самостоятельная российская платформа: полный стек протоколов плюс собственные аппаратные зонды SmartSFP для замера качества каналов связи. Больше 100 внедрений, среди них ПФР, Ростелеком, Минцифры, БПС-Сбербанк; директор ДИТ последнего публично подтвердил, что работы выполнены как надо. Из ML-инструментов — RCA, корреляция событий, контроль SLA. Основное преимущество – сертифицирована как средство измерения. Уровни 1–2.

GIMS (Gelarm) — связка из трех модулей: мониторинг (по функциям замена IBM Tivoli Netcool OMNIbus), инвентаризация с топологией и интеграционная шина с ETL. Открытый код, горизонтальное масштабирование кластерами до 64 серверов. Пять лет на рынке, больше 25 крупных проектов. Сам вендор позиционирует продукт как прямую замену западного enterprise-стека. Уровни 1–2.

Artimate — аналитическая AIOps-платформа. Сама данные не собирает: тянет события из Zabbix, GIMS, Пульта, wiSLA и прочих источников через коннектор OIM. ML-корреляция, детекция аномалий, карты причинно-следственных связей. В реестре ИИ-решений Минпромторга. Предназначен для инфраструктур с потоком от 3000 событий в секунду, у которых первый уровень уже есть, а вот команда с потоком уже не справляется. Уровни 2–3.

Monq (Monq Digital Lab) — самый широкий по функциям продукт в обзоре. Редакция Business закрывает уровни 2–4: зонтичный мониторинг, CMDB, AIOps-корреляция, бизнес-дашборды для топов. Enterprise добавляет инфраструктурный мониторинг и синтетику. В реестре российского ПО с 2020 года. Из публичных кейсов с цифрами — X5 Group (больше миллиона объектов), НЛМК, ДИТ Москвы (ROI проекта 150%, расходы на мониторинг интерфейсов в 20 раз ниже). Уровни 1–4, смотря какая редакция.

Кто какие уровни мониторинга закрывает

На первом уровне есть выбор на любой бюджет и требования. Zabbix, Пульт, wiSLA, GIMS – можно подстроиться под любые требования: и по лицензионной чистоте, и по вендорской поддержке, и под специфику конкретной инфраструктуры.

Второй уровень держат wiSLA (частично), GIMS и Monq Business. GIMS более продвинут в инвентаризации и контроле SLA/OLA по аутсорсинговым договорам, Monq — в бизнес-сервисной модели и едином оперативном центре службы мониторинга.

Третий уровень — самое узкое место рынка. По сути, два варианта: Artimate и Monq Business с их AIOps-корреляцией. У Artimate ML-аналитика глубже, но он жестко требует зрелого первого уровня: без приличного потока событий моделям просто не на чем учиться.

Четвертый уровень закрывает один Monq. Это единственный продукт в обзоре, который прямо заявляет бизнес-наблюдаемость как свою задачу и подкрепляет это кейсами с конкретными цифрами.

И тут стоит оговориться: продукты из этого списка по большому счету друг с другом не конкурируют. Пульт на первом уровне и Artimate на третьем — это не «или-или», а два слоя одной архитектуры. По-настоящему взаимоисключающий выбор всплывает ровно в одной паре: GIMS против Monq Enterprise в роли зонтичной платформы уровней 1–2.

И да, на презентациях вендоров все это работает, но проверять под свою нагрузку все равно придется самому.

Как выбирать платформу мониторинга

Небольшая инфраструктура и нет денег на лицензии — Zabbix + Grafana. Закрывает первый уровень, и для такого случая больше ничего не нужно.

Мигрируете с IBM Tivoli или HP OpenView — GIMS. Прямая функциональная замена с поддержкой контрактных SLA/OLA, а бесшовная миграция — это основной сценарий, который вендор сам же и продает.

Есть Zabbix, но алертов столько, что их уже никто не читает, — не трогайте Zabbix, разверните сверху Artimate или Monq Business. Zabbix остается источником событий, а новый слой берет на себя корреляцию и нормальное отображение инцидентов.

Нужен единый ситуационный центр под CIO — Monq Business или Enterprise. Единственный, у кого есть подтвержденные кейсы на уровне бизнес-наблюдаемости.

Критичен контроль качества каналов и SLA с операторами — wiSLA. Аппаратные зонды и метрологические сертификаты дают то, чего чисто программные конкуренты предложить не могут.

Принцип во всех случаях один: начинать с первого уровня и идти вверх по мере того, как растет инфраструктура и взрослеют процессы. Тащить Monq Enterprise в организацию, где еще толком не настроен сбор метрик, — затея гиблая: продукту нужна определенная организационная зрелость, иначе он встанет дорогим памятником. А там, где 2000+ объектов и несколько разрозненных систем мониторинга, Artimate или Monq окупаются за счет сэкономленного ручного труда дежурных инженеров уже в первый год.

Zabbix — отличная точка старта. Но именно старта, а не финиша.

Опубликовано 08.06.2026

Похожие статьи