Monitoring & Observability
Die Bereitstellung wird mit einem schlanken, hochdichten Observability-Stack ausgeliefert, damit Ihr Betriebsteam volle Transparenz über sowohl die Plattform als auch die Anwendung hat.
Der Stack
| Anliegen | Werkzeug | Rolle |
|---|---|---|
| Metriken | vmagent → VictoriaMetrics | Scrapt Performance-Endpunkte über Namespaces hinweg in einen verteilten Speicher (vmstorage, vminsert, vmselect). |
| Logs | Vector → VictoriaLogs | Sammelt stdout/stderr und leitet sie zur strukturierten Suche weiter. |
| Dashboards | Grafana | Verbindet sich mit VictoriaMetrics und VictoriaLogs als Datenquellen. |
Was überwacht werden soll
- Anwendungszustand — Anfragerate, Fehlerrate und Latenz des Cockpit-Frontends und des Rust-API-Backends.
- OpenBao — Siegelstatus, Raft-Leadership und Anfragedurchsatz. Ein entsiegeltes, fehlerfreies Quorum ist kritisch.
- PostgreSQL — Replikations-Lag, Verbindungen und Festplattenauslastung auf Primary und Replikaten.
- Redis — Cluster-Zustand und Master-/Replikat-Failover-Ereignisse.
- Plattform — Knoten-CPU/-Arbeitsspeicher, Pod-Neustarts und PersistentVolume-Kapazität.
Empfohlene Warnungen
| Warnung | Bedingung |
|---|---|
| OpenBao versiegelt | Ein beliebiger OpenBao-Knoten meldet sealed = true |
| PostgreSQL-Replikat-Lag | Lag > 30 s über mehr als 5 Min. |
| Pod-Crash-Loop | Ein beliebiger DuoKey-Pod startet > 3 Mal in 10 Min. neu |
| Ingress 5xx | 5xx-Rate > 1 % über 5 Min. |
| PV fast voll | Ein beliebiges PersistentVolume > 85 % ausgelastet |
| Backup fehlgeschlagen | Geplantes Velero-Backup wurde nicht erfolgreich abgeschlossen |
Zugriff auf Dashboards
Grafana wird über eine OpenShift-Route im Namespace duokey-observability
bereitgestellt:
oc get route grafana -n duokey-observability
Importieren Sie die in Ihrem Auslieferungspaket enthaltenen DuoKey-Dashboards oder erstellen Sie Ihre eigenen auf Basis der Datenquellen VictoriaMetrics/VictoriaLogs.