Files
monitoring/PRD.md
T

2.3 KiB

PRD — Мониторинг кластера

Цель

Единый стек мониторинга всех серверов и сервисов (Garage, tproxy, инфраструктура) на bigbox с веб-доступом через Grafana, без публикации служебных портов наружу.

Пользователи

  • estorozhenko (admin) — полный доступ
  • гостевая учётка (readonly) — просмотр дашбордов (пароль 1qazXSW2)

Функциональные требования

  • Метрики: Garage-кластер (3 ноды), система каждой ноды (CPU/память/диск/сеть/доступность), tproxy (sessions/streams/traffic/backend errors), blackbox (ICMP RTT)
  • Сеть: по каждому физическому интерфейсу на каждой ноде отдельный график (RX/TX вместе) + утилизация канала (%)
  • Дашборды: per-node (Node ) + Garage Cluster + Vinograd WAN + tproxy
  • Алерты: garage (down/unstable), tproxy, vinograd WAN — правила в alerts.yml
  • Логи: promtail → Loki → Grafana (retention 7d)

Нефункциональные

  • Порт node-exporter и admin-эндпоинты НЕ публикуются наружу (наследие: vps03 — только WG; garage :3903 — только WG-подсеть; tproxy :8081 — loopback+туннель)
  • Катастрофоустойчивость: git gitverse (источник истины) + gitea pull-mirror на bigbox
  • Retention: 30d (прометеевский TSDB)

Границы (НЕ делаем)

  • Трейсы (до них «не доросли»)
  • Мониторинг сети за роутером (кроме ICMP-пробы vinograd)
  • Панель авторизации вне Grafana

Критерии готовности

  • Все ноды и сервисы в Prometheus (up)
  • Дашборды: per-node + garage + vinograd-wan + tproxy видны в Grafana
  • Алерты доставляются в Grafana Alerts
  • README/EXPERIENCE/PLAN/STATUS/TODO/WALKTHROUGH актуальны
  • Разные admin_token/metrics_token; пароль Grafana; уведомления (Telegram)