docs: закрытие сессии 2026-09-08 — STATUS/TODO/WALKTHROUGH/PRD

This commit is contained in:
kpa39l
2026-09-08 16:58:45 +00:00
parent eaafb1ff3a
commit 4382f9c0ff
4 changed files with 173 additions and 0 deletions
+36
View File
@@ -0,0 +1,36 @@
# PRD — Мониторинг кластера
## Цель
Единый стек мониторинга всех серверов и сервисов (Garage, tproxy, инфраструктура)
на bigbox с веб-доступом через Grafana, без публикации служебных портов наружу.
## Пользователи
- estorozhenko (admin) — полный доступ
- гостевая учётка (readonly) — просмотр дашбордов (пароль 1qazXSW2)
## Функциональные требования
- Метрики: Garage-кластер (3 ноды), система каждой ноды (CPU/память/диск/сеть/доступность),
tproxy (sessions/streams/traffic/backend errors), blackbox (ICMP RTT)
- Сеть: по каждому физическому интерфейсу на каждой ноде отдельный график
(RX/TX вместе) + утилизация канала (%)
- Дашборды: per-node (Node <host>) + Garage Cluster + Vinograd WAN + tproxy
- Алерты: garage (down/unstable), tproxy, vinograd WAN — правила в alerts.yml
- Логи: promtail → Loki → Grafana (retention 7d)
## Нефункциональные
- Порт node-exporter и admin-эндпоинты НЕ публикуются наружу (наследие: vps03 —
только WG; garage :3903 — только WG-подсеть; tproxy :8081 — loopback+туннель)
- Катастрофоустойчивость: git gitverse (источник истины) + gitea pull-mirror на bigbox
- Retention: 30d (прометеевский TSDB)
## Границы (НЕ делаем)
- Трейсы (до них «не доросли»)
- Мониторинг сети за роутером (кроме ICMP-пробы vinograd)
- Панель авторизации вне Grafana
## Критерии готовности
- [x] Все ноды и сервисы в Prometheus (up)
- [x] Дашборды: per-node + garage + vinograd-wan + tproxy видны в Grafana
- [x] Алерты доставляются в Grafana Alerts
- [x] README/EXPERIENCE/PLAN/STATUS/TODO/WALKTHROUGH актуальны
- [ ] Разные admin_token/metrics_token; пароль Grafana; уведомления (Telegram)