Команда инженеров · свой ЦОД в РФ · своё железо · своя панель · CloudStack + Linstor · MCP · база знаний по self-hosted
Решение · Наблюдаемость и аудит

Наблюдаемость Pro: метрики, дашборды и алерты

Индустриальный стек наблюдаемости на своих серверах: Prometheus собирает метрики хостов и контейнеров, Grafana рисует дашборды, Alertmanager маршрутизирует алерты, а ntfy доставляет их на телефон. Стандарт cloud-native под ключ, без Datadog и Grafana Cloud, данные под 152-ФЗ. Все собрано и проверено на живом стенде Fatmetal Cloud.

Слой: готовое решение (Pro-тир) Компонентов: 5 Серверов: 1 Собрано на живом стенде Fatmetal Cloud
Prometheus + Grafana 1 сервер склейка доказана живьем self-hosted данные под 152-ФЗ

Что вы получаете

Входит в решение
  • сбор метрик хостов и контейнеров по стандарту CNCF (Prometheus + node_exporter + cAdvisor)
  • богатые дашборды на всю инфру, готовый Node Exporter Full из коробки (Grafana)
  • правила алертов на PromQL с маршрутизацией и группировкой (Alertmanager)
  • единый хаб уведомлений: любой алерт прилетает push на телефон (ntfy)
Когда вам проще другой тир
  • нужен мониторинг «поставил и работает» без PromQL и экспортеров - берите тир на Beszel
  • нужен аудит безопасности класса SIEM - это Wazuh из базового решения наблюдаемости
  • нужна многолетняя история метрик - потребуется remote-write в Mimir/Thanos поверх этого стека
Серверов: 1 (стек легкий) Стоимость: от ~500 руб/мес Время сборки: минуты (один clic-deploy) Данные: целиком на вашем железе Сложность: средняя (PromQL, экспортеры) Прод-готовность: да, все за TLS
Задача

Когда мониторинга «из коробки» уже мало

Инфраструктура выросла из одного хоста - нужен гибкий стандарт метрик, а не витрина.

Базовое решение наблюдаемости на легких инструментах хорошо, пока серверов немного и хватает готовых дашбордов. Как только появляются контейнеры, свои сервисы с бизнес-метриками и требование считать по метрикам сложные величины - перцентили латентности, скорость ошибок, произвольные агрегации - нужен инструмент, который это умеет. Это Prometheus: он собирает метрики по pull-модели, хранит их как временные ряды и дает язык PromQL, а Grafana превращает их в дашборды.

Облачный путь - Datadog, Grafana Cloud, New Relic - закрывает это быстро, но счет растет с числом хостов и объемом метрик, а данные уезжают в чужое облако. Этот стек дает тот же индустриальный стандарт на вашем сервере: без потолка по числу целей и без выноса телеметрии наружу.

Как устроено

Один сервер, пять компонентов, один поток алертов

Стек легкий - весь помещается на младший тариф.

Схема: экспортеры node_exporter и cAdvisor отдают метрики, Prometheus их скрейпит и хранит, Grafana рисует дашборды, Alertmanager маршрутизирует алерты в хаб ntfy, оттуда push на телефон
Поток данных: экспортеры отдают метрики (пунктир), Prometheus их скрейпит, Grafana рисует, сработавшие правила уходят через Alertmanager в хаб ntfy (сплошные), оттуда push на телефон.

Одна VM (CPU2-RAM4, ~500 руб/мес). В отличие от тяжелого SIEM, весь метрик-стек легкий: сам Prometheus в простое ест около 45 МиБ, вся связка с Grafana - примерно 274 МиБ. Поэтому Prometheus, экспортеры, Grafana, Alertmanager и ntfy спокойно живут на одном младшем тарифе. Наружу торчит только Caddy с TLS: Grafana в корне домена, веб Prometheus - на пути /prom.

Prometheusnode_exportercAdvisorGrafanaAlertmanagerntfyCaddy + TLSDocker
Компоненты

Пять инструментов, каждый на своем уровне

Сбор, хранение, визуализация, маршрутизация, доставка.

КомпонентУровеньЧто закрывает
PrometheusСбор и хранениеpull-скрейп метрик, TSDB, язык PromQL, правила алертов
node_exporterМетрики хостаCPU, RAM, диск, сеть, файловые системы
cAdvisorМетрики контейнеровпотребление ресурсов Docker-контейнерами
GrafanaВизуализациядашборды поверх Prometheus, готовый Node Exporter Full, unified alerting
Alertmanager + ntfyМаршрут и доставкагруппировка и маршрутизация алертов, push на телефон и webhook
https://45-15-159-158.fatmetal.net/
Дашборд Node Exporter Full в Grafana: гейджи CPU и памяти, графики нагрузки, сети и диска
Grafana на живом стенде: готовый дашборд Node Exporter Full поверх данных Prometheus - CPU, память, сеть, диск на одном экране.
Склейка

Алерт проходит весь путь: Prometheus - Alertmanager - ntfy

Это то, что превращает набор сервисов в рабочую систему оповещения.

Дашборды показывают состояние, но смотреть на них круглосуточно нельзя. Ценность стека - в том, что правило алерта на PromQL проходит весь путь автоматически: Prometheus вычисляет условие, передает сработавший алерт в Alertmanager, а тот по маршруту отправляет его webhook-ом в хаб ntfy. На стенде мы завели демо-правило и проверили цепочку живьем:

  • Prometheus - правило на PromQL перешло в состояние FIRING;
  • Alertmanager - принял алерт (active) и отправил по маршруту в ntfy;
  • ntfy - в топике infra-alerts появилось сообщение с текстом «алерт долетел».
https://45-15-159-158.fatmetal.net/prom/alerts
Страница alerts в Prometheus: правило HighNodeCPULoad в состоянии FIRING
Живой стенд: правило перешло в FIRING, ушло через Alertmanager и долетело в топик ntfy infra-alerts (доставка подтверждена на стенде). Один конвейер вместо ручного слежения.
i

Почему это важно. Вы получаете не четыре дашборда, за которыми надо следить, а один поток: любое условие - забитый диск, недоступная цель, всплеск ошибок - само превращается в push на телефон. Alertmanager при этом группирует и глушит шум, а ntfy бесплатен и ставит приложение на телефон.

Два тира

Чем этот стек отличается от базового

Одно направление, два уровня под разные задачи.

Базовый тир (Beszel-стек)Pro-тир (этот стек)
Порог входаминимальный, UI из коробкивыше: экспортеры, PromQL, дашборды
Метрикиготовые панели хоста и контейнеровлюбые, включая бизнес-метрики и произвольный PromQL
Визуализациявстроенные дашбордыGrafana: библиотека дашбордов, свои панели
Масштабнебольшой паркстандарт cloud-native, растет с инфрой
Комубыстро закрыть базовый мониторингдевопс/SRE, контейнеры, рост
Стек против облака

Что меняется по сравнению с SaaS

Сравнение по тому, что реально влияет на выбор.

Этот стек (self-hosted)Datadog / Grafana Cloud
Стоимостьфикс ~500 руб/мес за серверрастет с числом хостов и объемом метрик
Где данныецеликом на вашем железе, 152-ФЗтелеметрия в чужом облаке
Лимитынет лимита на число целей и метриктарифные лимиты, переплата за превышение
Алертысвой Alertmanager + ntfy, push бесплатночасто отдельная платная опция
Стандартоткрытый Prometheus/PromQL, без вендор-локапроприетарные агенты и форматы
Конфигурация

Рекомендуемая конфигурация

Один сервер - стек легкий.

СерверCPU2-RAM4-DISK50 - весь стек, ~500 руб/мес
СоставPrometheus + node_exporter + cAdvisor + Grafana + Alertmanager + ntfy
ОСUbuntu 24.04 LTS, Docker, Caddy с авто-TLS (Grafana в корне, Prometheus на /prom)
Потребление~274 МиБ RAM в простое (сам Prometheus ~45 МиБ), образы ~2.2 ГБ
i

Почему одна машина. В отличие от SIEM-тира с тяжелым индексатором на JVM, метрик-стек легкий: все пять сервисов вместе занимают около 274 МиБ, поэтому им хватает младшего тарифа. Потолок - в кардинальности метрик: следите за числом рядов на большом парке.

Подводные камни

На что смотреть при сборке

Грабли, которые лучше обойти сразу.

!

Публикация под поддиректорией. Если Prometheus живет на пути /prom, задайте флаг --web.route-prefix, тот же префикс в пути метрик само-скрейпа и в URL источника данных Grafana - иначе панели покажут «No data», а часть целей упрется в 404.

!

Взрыв кардинальности. Метки с высокой изменчивостью плодят миллионы рядов и съедают RAM. Держите метки под контролем - это главный риск стека на масштабе.

!

Без экспортеров пусто. Prometheus сам ничего не показывает. Подключите node_exporter, cAdvisor и экспортеры под ваши сервисы, иначе дашборды будут пустыми.

Соберем это под вас

Компоненты стека есть в маркетплейсе Fatmetal с готовым образом, доменом и TLS - разверните весь Prometheus + Grafana одним заказом. Разберитесь по статьям или закажите готовый сервер и получите рабочую наблюдаемость за минуты.

Собрано и проверено на живом стенде Fatmetal Cloud, июль 2026. Склейка Prometheus - Alertmanager - ntfy проверена живьем: правило перешло в FIRING и долетело в топик ntfy. На новых версиях детали интерфейсов могут отличаться.

Спросить инженера в TelegramМы на связи