docs: закрытие сессии 2026-09-08 — STATUS/TODO/WALKTHROUGH/PRD

This commit is contained in:
kpa39l
2026-09-08 16:58:45 +00:00
parent eaafb1ff3a
commit 4382f9c0ff
4 changed files with 173 additions and 0 deletions
+45
View File
@@ -0,0 +1,45 @@
# Мониторинг кластера — Статус
Обновлено: 2026-09-08 (сессия @session:default/20260908_142639_b2d5b4)
## Текущее состояние
Стек мониторинга на bigbox (/opt/monitoring): Prometheus 2.53 + Grafana 11.1 +
Loki + promtail. Собирает: Garage-кластер (vps01/bigbox/vps02 :3903), системы
всех 4 нод (node-exporter :9100 по WireGuard), tproxy (vps03, loopback-туннель).
Дашборды: **4 per-node** (Node vps01/vps02/vps03/bigbox) + Garage Cluster +
Vinograd WAN + tproxy-панели. vps03 подключён к WG (10.8.0.3), порты наружу
не светятся. Все 4 node-таргета up. Всё в git (gitverse + gitea mirror).
## Сделано (за сессию 2026-09-08)
- vps03 подключён к WireGuard: 10.8.0.3/24, hub vps01 (5.129.217.146:51820),
пиры добавлены на vps01/bigbox/vps02 (AllowedIPs пира vps01 расширен до
`10.8.0.1/32, 10.8.0.3/32` для возвратного трафика — грабль зафиксирован)
- node-exporter установлен на vps03 (apt), слушает 10.8.0.3:9100 (наружу 77.67.89.154:9100 закрыт)
- prometheus.yml: job `node` → 4 таргета (10.8.0.1/2/3/4:9100), все up
- Дашборды: **отдельный на каждую ноду** (uid node-<host>), в каждом:
availability + disk free + memory + load + **Net <iface> RX/TX (bytes/s)** +
**Net <iface> utilization (%)** (физические интерфейсы, контейнерные исключены)
- README.md/EXPERIENCE.md обновлены (грабли: node_network_* метрики, speed=-125000 на виртуалках)
## В работе / Следующие шаги
- [ ] Разные admin_token / metrics_token в Garage (совпадают)
- [ ] Поменять пароль Grafana с дефолтного (пользователь estorozhenko, пароль сменён вручную)
- [ ] Уведомления алертов (Telegram/почта)
- [ ] Проверить визуально дашборды Node в Grafana (после 1-2ч данных)
## Как запустить / проверить
```bash
cd /opt/monitoring && docker compose ps # стек
curl -s "http://127.0.0.1:9090/api/v1/targets?state=any" | python3 -m json.tool # node ×4 up
# Grafana: http://bigbox:3001 (или https://grafana.nixg.ru) → дашборды Node vps01/02/03/bigbox
```
## Ключевые артефакты
- /opt/monitoring/docker-compose.yml, prometheus.yml, alerts.yml
- /opt/monitoring/grafana/dashboards/node-<host>.json (4 шт), garage-cluster.json, vinograd-wan.json
- /opt/monitoring/grafana/provisioning/datasources/datasources.yml, dashboards/dashboards.yml
- README.md, EXPERIENCE.md, PLAN.md (в этом каталоге), STATUS.md/TODO.md/WALKTHROUGH.md
## Открытые вопросы
- Нужен ли утилизация для vps01/vps02 с реальной скоростью линка (сейчас хардкод 1Гбит/с)
- Оставлять ли tproxy-tunnel.service (SSH-туннель) — vps03 уже в WG, туннель не нужен