Наблюдаемость Pro: метрики, дашборды и алерты
Индустриальный стек наблюдаемости на своих серверах: Prometheus собирает метрики хостов и контейнеров, Grafana рисует дашборды, Alertmanager маршрутизирует алерты, а ntfy доставляет их на телефон. Стандарт cloud-native под ключ, без Datadog и Grafana Cloud, данные под 152-ФЗ. Все собрано и проверено на живом стенде Fatmetal Cloud.
Что вы получаете
- сбор метрик хостов и контейнеров по стандарту CNCF (Prometheus + node_exporter + cAdvisor)
- богатые дашборды на всю инфру, готовый Node Exporter Full из коробки (Grafana)
- правила алертов на PromQL с маршрутизацией и группировкой (Alertmanager)
- единый хаб уведомлений: любой алерт прилетает push на телефон (ntfy)
- нужен мониторинг «поставил и работает» без PromQL и экспортеров - берите тир на Beszel
- нужен аудит безопасности класса SIEM - это Wazuh из базового решения наблюдаемости
- нужна многолетняя история метрик - потребуется remote-write в Mimir/Thanos поверх этого стека
Когда мониторинга «из коробки» уже мало
Инфраструктура выросла из одного хоста - нужен гибкий стандарт метрик, а не витрина.
Базовое решение наблюдаемости на легких инструментах хорошо, пока серверов немного и хватает готовых дашбордов. Как только появляются контейнеры, свои сервисы с бизнес-метриками и требование считать по метрикам сложные величины - перцентили латентности, скорость ошибок, произвольные агрегации - нужен инструмент, который это умеет. Это Prometheus: он собирает метрики по pull-модели, хранит их как временные ряды и дает язык PromQL, а Grafana превращает их в дашборды.
Облачный путь - Datadog, Grafana Cloud, New Relic - закрывает это быстро, но счет растет с числом хостов и объемом метрик, а данные уезжают в чужое облако. Этот стек дает тот же индустриальный стандарт на вашем сервере: без потолка по числу целей и без выноса телеметрии наружу.
Один сервер, пять компонентов, один поток алертов
Стек легкий - весь помещается на младший тариф.
Одна VM (CPU2-RAM4, ~500 руб/мес). В отличие от тяжелого SIEM, весь метрик-стек легкий: сам Prometheus в простое ест около 45 МиБ, вся связка с Grafana - примерно 274 МиБ. Поэтому Prometheus, экспортеры, Grafana, Alertmanager и ntfy спокойно живут на одном младшем тарифе. Наружу торчит только Caddy с TLS: Grafana в корне домена, веб Prometheus - на пути /prom.
Пять инструментов, каждый на своем уровне
Сбор, хранение, визуализация, маршрутизация, доставка.
| Компонент | Уровень | Что закрывает |
|---|---|---|
| Prometheus | Сбор и хранение | pull-скрейп метрик, TSDB, язык PromQL, правила алертов |
| node_exporter | Метрики хоста | CPU, RAM, диск, сеть, файловые системы |
| cAdvisor | Метрики контейнеров | потребление ресурсов Docker-контейнерами |
| Grafana | Визуализация | дашборды поверх Prometheus, готовый Node Exporter Full, unified alerting |
| Alertmanager + ntfy | Маршрут и доставка | группировка и маршрутизация алертов, push на телефон и webhook |
Алерт проходит весь путь: Prometheus - Alertmanager - ntfy
Это то, что превращает набор сервисов в рабочую систему оповещения.
Дашборды показывают состояние, но смотреть на них круглосуточно нельзя. Ценность стека - в том, что правило алерта на PromQL проходит весь путь автоматически: Prometheus вычисляет условие, передает сработавший алерт в Alertmanager, а тот по маршруту отправляет его webhook-ом в хаб ntfy. На стенде мы завели демо-правило и проверили цепочку живьем:
- Prometheus - правило на PromQL перешло в состояние
FIRING; - Alertmanager - принял алерт (
active) и отправил по маршруту в ntfy; - ntfy - в топике
infra-alertsпоявилось сообщение с текстом «алерт долетел».
Почему это важно. Вы получаете не четыре дашборда, за которыми надо следить, а один поток: любое условие - забитый диск, недоступная цель, всплеск ошибок - само превращается в push на телефон. Alertmanager при этом группирует и глушит шум, а ntfy бесплатен и ставит приложение на телефон.
Чем этот стек отличается от базового
Одно направление, два уровня под разные задачи.
| Базовый тир (Beszel-стек) | Pro-тир (этот стек) | |
|---|---|---|
| Порог входа | минимальный, UI из коробки | выше: экспортеры, PromQL, дашборды |
| Метрики | готовые панели хоста и контейнеров | любые, включая бизнес-метрики и произвольный PromQL |
| Визуализация | встроенные дашборды | Grafana: библиотека дашбордов, свои панели |
| Масштаб | небольшой парк | стандарт cloud-native, растет с инфрой |
| Кому | быстро закрыть базовый мониторинг | девопс/SRE, контейнеры, рост |
Что меняется по сравнению с SaaS
Сравнение по тому, что реально влияет на выбор.
| Этот стек (self-hosted) | Datadog / Grafana Cloud | |
|---|---|---|
| Стоимость | фикс ~500 руб/мес за сервер | растет с числом хостов и объемом метрик |
| Где данные | целиком на вашем железе, 152-ФЗ | телеметрия в чужом облаке |
| Лимиты | нет лимита на число целей и метрик | тарифные лимиты, переплата за превышение |
| Алерты | свой Alertmanager + ntfy, push бесплатно | часто отдельная платная опция |
| Стандарт | открытый Prometheus/PromQL, без вендор-лока | проприетарные агенты и форматы |
Рекомендуемая конфигурация
Один сервер - стек легкий.
| Сервер | CPU2-RAM4-DISK50 - весь стек, ~500 руб/мес |
|---|---|
| Состав | Prometheus + node_exporter + cAdvisor + Grafana + Alertmanager + ntfy |
| ОС | Ubuntu 24.04 LTS, Docker, Caddy с авто-TLS (Grafana в корне, Prometheus на /prom) |
| Потребление | ~274 МиБ RAM в простое (сам Prometheus ~45 МиБ), образы ~2.2 ГБ |
Почему одна машина. В отличие от SIEM-тира с тяжелым индексатором на JVM, метрик-стек легкий: все пять сервисов вместе занимают около 274 МиБ, поэтому им хватает младшего тарифа. Потолок - в кардинальности метрик: следите за числом рядов на большом парке.
На что смотреть при сборке
Грабли, которые лучше обойти сразу.
Публикация под поддиректорией. Если Prometheus живет на пути /prom, задайте флаг --web.route-prefix, тот же префикс в пути метрик само-скрейпа и в URL источника данных Grafana - иначе панели покажут «No data», а часть целей упрется в 404.
Взрыв кардинальности. Метки с высокой изменчивостью плодят миллионы рядов и съедают RAM. Держите метки под контролем - это главный риск стека на масштабе.
Без экспортеров пусто. Prometheus сам ничего не показывает. Подключите node_exporter, cAdvisor и экспортеры под ваши сервисы, иначе дашборды будут пустыми.
Соберем это под вас
Компоненты стека есть в маркетплейсе Fatmetal с готовым образом, доменом и TLS - разверните весь Prometheus + Grafana одним заказом. Разберитесь по статьям или закажите готовый сервер и получите рабочую наблюдаемость за минуты.
Собрано и проверено на живом стенде Fatmetal Cloud, июль 2026. Склейка Prometheus - Alertmanager - ntfy проверена живьем: правило перешло в FIRING и долетело в топик ntfy. На новых версиях детали интерфейсов могут отличаться.