# PRD — Мониторинг кластера ## Цель Единый стек мониторинга всех серверов и сервисов (Garage, tproxy, инфраструктура) на bigbox с веб-доступом через Grafana, без публикации служебных портов наружу. ## Пользователи - estorozhenko (admin) — полный доступ - гостевая учётка (readonly) — просмотр дашбордов (пароль 1qazXSW2) ## Функциональные требования - Метрики: Garage-кластер (3 ноды), система каждой ноды (CPU/память/диск/сеть/доступность), tproxy (sessions/streams/traffic/backend errors), blackbox (ICMP RTT) - Сеть: по каждому физическому интерфейсу на каждой ноде отдельный график (RX/TX вместе) + утилизация канала (%) - Дашборды: per-node (Node ) + Garage Cluster + Vinograd WAN + tproxy - Алерты: garage (down/unstable), tproxy, vinograd WAN — правила в alerts.yml - Логи: promtail → Loki → Grafana (retention 7d) ## Нефункциональные - Порт node-exporter и admin-эндпоинты НЕ публикуются наружу (наследие: vps03 — только WG; garage :3903 — только WG-подсеть; tproxy :8081 — loopback+туннель) - Катастрофоустойчивость: git gitverse (источник истины) + gitea pull-mirror на bigbox - Retention: 30d (прометеевский TSDB) ## Границы (НЕ делаем) - Трейсы (до них «не доросли») - Мониторинг сети за роутером (кроме ICMP-пробы vinograd) - Панель авторизации вне Grafana ## Критерии готовности - [x] Все ноды и сервисы в Prometheus (up) - [x] Дашборды: per-node + garage + vinograd-wan + tproxy видны в Grafana - [x] Алерты доставляются в Grafana Alerts - [x] README/EXPERIENCE/PLAN/STATUS/TODO/WALKTHROUGH актуальны - [ ] Разные admin_token/metrics_token; пароль Grafana; уведомления (Telegram)