Мониторинг инфраструктуры не заканчивается на Zabbix
Мониторинг нужен не только для того, чтобы зафиксировать аварию постфактум, а чтобы еще управлять мощностью и доступностью до того, как авария случится, а также контролировать исполнение SLA.
Стоимость отсутствия мониторинга набегает из нескольких статей, и считать их вместе почему-то никто не любит.
Самое очевидное — прямые потери от простоев. Gartner оценивает час незапланированного простоя enterprise-компании в сумму свыше $300 000 (тут придется поверить аналитикам на слово). Четыре часа, которые команда без нормального мониторинга тратит на поиск причины, — это не «издержки производства», а вполне конкретные деньги, даже если в компании никто не сможет посчитать. Для банка, ритейлера, логистики или телекома порядок цифр сопоставим и с нашими реалиями.
Дальше идут скрытые потери от деградации, и вот их недооценивают чаще всего. Приложение работает, но медленно. СУБД отвечает, но с задержками. Канал жив, но пакеты теряются. Пользователь сначала терпит, потом пишет в поддержку, а потом уходит — и уходит не потому, что «не работает», а потому, что «неудобно». Без мониторинга такая деградация спокойно живет неделями, а то и месяцами, и замечают ее обычно тогда, когда уже поздно.
А ведь еще есть составные проблемы и постепенно развивающаяся деградация, которые Zabbix не сможет вам помочь увидеть.
Есть еще риски организационные, и бьют они по людям, а не по сервисам. Когда ИТ-служба узнает о падении сервиса от клиента или, того хуже, из соцсетей — внутри компании это уже репутационная история. Доверие к ИТ-руководителю набирается годами, а может сгореть за одну аварию. Тут проактивный мониторинг работает не столько как технология, сколько как способ держать лицо: с ним ИТ-директор приходит к бизнесу с цифрами в обосновании стратегии, а не с объяснительной.
И, наконец, регуляторика. Для финансового сектора, объектов КИИ и госструктур непрерывность сервисов прописана в законе. Отсутствие документированного мониторинга — это нарушение, которое проверяющий вполне способен найти и квалифицировать как нарушение правил эксплуатации информационных систем с тяжкими последствиями (ст. 274.1 ч. 3 УК). Звучит абстрактно ровно до первой проверки.
Если свести все вместе, то мониторинг — это не расходы на ПО, а страховка от потерь, которые на порядок больше цены любой платформы. Именно с этой стороны его и стоит продавать бизнесу
Четыре уровня мониторинга для разных задач
Самая частая ошибка, которую я вижу в компаниях, — отношение к мониторингу как к чему-то однородному. «Поставили Zabbix — значит, мониторинг есть». На деле это стек из четырех уровней, и каждый отвечает на свои вопросы для своих заказчиков.
Уровень 1 — сбор данных и инфраструктурный мониторинг. Метрики хостов, сети, СУБД, агенты на серверах. Вопрос простой: «живо ли железо и софт?». Аудитория — системный администратор и сетевой инженер.
Уровень 2 — зонтичный мониторинг. Здесь данные из разных источников сводятся вместе, строится топология и единая сервисная модель, считаются SLA и OLA. Системы отвечают уже на вопрос «как состояние железа отражается на бизнес-сервисах?». Аудитория — ИТ-директор и руководители эксплуатации. Без этого уровня директор видит бесконечную ленту алертов, но не понимает, какие из них прямо сейчас бьют по ключевым бизнес-процессам, — если, конечно, сам не сидит по локоть в инфраструктуре.
Уровень 3 — AIOps и интеллектуальный анализ. ML-корреляция событий, автоматический поиск первопричины, детекция аномалий, предиктивная аналитика. Вопрос: «когда упадет, почему упало и что будет дальше?». Когда поток алертов переваливает за 3000 событий в секунду, без этого уровня команда физически тонет: люди начинают игнорировать алерты, и мониторинг, по сути, перестает быть мониторингом.
Уровень 4 — бизнес-наблюдаемость. ИТ описывается на языке бизнеса: доступность конкретного сервиса, выполнение договорных SLA, влияние сбоев на выручку. Вопрос самый верхнеуровневый: «что прямо сейчас происходит с бизнесом?». Аудитория – бизнес и топ-менеджмент.
Важно вот что: уровни наслаиваются, а не заменяют друг друга. Зонтичный мониторинг не на чем построить без источников данных с первого уровня, а бизнес-наблюдаемость не появится без сервисной модели со второго. Перепрыгнуть ступеньку не выйдет, как бы ни хотелось.

Прежде чем перейти к списку, обозначу, кого я в него не взял и почему. За скобки вынесены две категории:
-
Продукты, заточенные под узкий российский стек (Astra Linux, только отечественное железо). На разнородной инфраструктуре, а именно такая у большинства крупных заказчиков – они не применимы.
-
Продукты, которые проигрывают Zabbix по охвату коннекторов. Включать их в обзор - это значит создавать иллюзию выбора там, где его нет.
Остается вот что.
Zabbix + Grafana — open source-фундамент. Тысячи шаблонов, SNMP, IPMI, JMX, агенты под любые платформы и ноль рублей за лицензии. Чего нет из коробки — зонтичного мониторинга, incident management и AIOps; все это придется либо интегрировать руками, либо надстраивать сверху. Уровень 1.
Пульт (Лаборатория Числитель) — российская надстройка над Zabbix. Берет весь его охват коннекторов, добавляет шаблоны под отечественное оборудование и отдельный модуль отчетности, который, как утверждает вендор, нормально себя чувствует в крупных проектах. В реестре российского ПО. Технологически стыкуется с Monq и Artimate. Уровень 1.
wiSLA (Wellink) — самостоятельная российская платформа: полный стек протоколов плюс собственные аппаратные зонды SmartSFP для замера качества каналов связи. Больше 100 внедрений, среди них ПФР, Ростелеком, Минцифры, БПС-Сбербанк; директор ДИТ последнего публично подтвердил, что работы выполнены как надо. Из ML-инструментов — RCA, корреляция событий, контроль SLA. Основное преимущество – сертифицирована как средство измерения. Уровни 1–2.
GIMS (Gelarm) — связка из трех модулей: мониторинг (по функциям замена IBM Tivoli Netcool OMNIbus), инвентаризация с топологией и интеграционная шина с ETL. Открытый код, горизонтальное масштабирование кластерами до 64 серверов. Пять лет на рынке, больше 25 крупных проектов. Сам вендор позиционирует продукт как прямую замену западного enterprise-стека. Уровни 1–2.
Artimate — аналитическая AIOps-платформа. Сама данные не собирает: тянет события из Zabbix, GIMS, Пульта, wiSLA и прочих источников через коннектор OIM. ML-корреляция, детекция аномалий, карты причинно-следственных связей. В реестре ИИ-решений Минпромторга. Предназначен для инфраструктур с потоком от 3000 событий в секунду, у которых первый уровень уже есть, а вот команда с потоком уже не справляется. Уровни 2–3.
Monq (Monq Digital Lab) — самый широкий по функциям продукт в обзоре. Редакция Business закрывает уровни 2–4: зонтичный мониторинг, CMDB, AIOps-корреляция, бизнес-дашборды для топов. Enterprise добавляет инфраструктурный мониторинг и синтетику. В реестре российского ПО с 2020 года. Из публичных кейсов с цифрами — X5 Group (больше миллиона объектов), НЛМК, ДИТ Москвы (ROI проекта 150%, расходы на мониторинг интерфейсов в 20 раз ниже). Уровни 1–4, смотря какая редакция.
Кто какие уровни мониторинга закрывает
На первом уровне есть выбор на любой бюджет и требования. Zabbix, Пульт, wiSLA, GIMS – можно подстроиться под любые требования: и по лицензионной чистоте, и по вендорской поддержке, и под специфику конкретной инфраструктуры.
Второй уровень держат wiSLA (частично), GIMS и Monq Business. GIMS более продвинут в инвентаризации и контроле SLA/OLA по аутсорсинговым договорам, Monq — в бизнес-сервисной модели и едином оперативном центре службы мониторинга.
Третий уровень — самое узкое место рынка. По сути, два варианта: Artimate и Monq Business с их AIOps-корреляцией. У Artimate ML-аналитика глубже, но он жестко требует зрелого первого уровня: без приличного потока событий моделям просто не на чем учиться.
Четвертый уровень закрывает один Monq. Это единственный продукт в обзоре, который прямо заявляет бизнес-наблюдаемость как свою задачу и подкрепляет это кейсами с конкретными цифрами.
И тут стоит оговориться: продукты из этого списка по большому счету друг с другом не конкурируют. Пульт на первом уровне и Artimate на третьем — это не «или-или», а два слоя одной архитектуры. По-настоящему взаимоисключающий выбор всплывает ровно в одной паре: GIMS против Monq Enterprise в роли зонтичной платформы уровней 1–2.
И да, на презентациях вендоров все это работает, но проверять под свою нагрузку все равно придется самому.
Как выбирать платформу мониторинга
Небольшая инфраструктура и нет денег на лицензии — Zabbix + Grafana. Закрывает первый уровень, и для такого случая больше ничего не нужно.
Мигрируете с IBM Tivoli или HP OpenView — GIMS. Прямая функциональная замена с поддержкой контрактных SLA/OLA, а бесшовная миграция — это основной сценарий, который вендор сам же и продает.
Есть Zabbix, но алертов столько, что их уже никто не читает, — не трогайте Zabbix, разверните сверху Artimate или Monq Business. Zabbix остается источником событий, а новый слой берет на себя корреляцию и нормальное отображение инцидентов.
Нужен единый ситуационный центр под CIO — Monq Business или Enterprise. Единственный, у кого есть подтвержденные кейсы на уровне бизнес-наблюдаемости.
Критичен контроль качества каналов и SLA с операторами — wiSLA. Аппаратные зонды и метрологические сертификаты дают то, чего чисто программные конкуренты предложить не могут.
Принцип во всех случаях один: начинать с первого уровня и идти вверх по мере того, как растет инфраструктура и взрослеют процессы. Тащить Monq Enterprise в организацию, где еще толком не настроен сбор метрик, — затея гиблая: продукту нужна определенная организационная зрелость, иначе он встанет дорогим памятником. А там, где 2000+ объектов и несколько разрозненных систем мониторинга, Artimate или Monq окупаются за счет сэкономленного ручного труда дежурных инженеров уже в первый год.
Zabbix — отличная точка старта. Но именно старта, а не финиша.
Опубликовано 08.06.2026

