Zum Hauptinhalt springen

Health Checks & Metriken

Diese Seite liefert Ihrem Betriebsteam konkrete Prüfungen und die wichtigsten zu beobachtenden Metriken. Sie ergänzt die Übersicht über den Stack unter Monitoring & Observability.

Täglicher Health Check (5 Minuten)​

Führen Sie diese Befehle aus, um zu bestätigen, dass die Plattform fehlerfrei läuft:

# 1. Alle DuoKey-Pods Running/Ready und über Knoten verteilt
oc get pods -n duokey -o wide

# 2. Cluster-Operatoren fehlerfrei
oc get clusteroperators | grep -vi "True.*False.*False"

# 3. Ingress-Route liefert TLS aus
oc get route -n duokey
curl -I https://cockpit.duokey.example.local

# 4. Secrets werden injiziert (kein Klartext auf der Festplatte)
oc get externalsecret -n duokey

# 5. GitOps synchron
argocd app get duokey | grep -E "Sync Status|Health Status"

# 6. PersistentVolume-Auslastung
oc get pvc -A

Externe / VM-Ebene:

# OpenBao: muss entsiegelt sein mit aktivem Raft-Leader
bao status

# PostgreSQL: Primary aktiv, Replikate streamen, geringer Lag
oc exec -n duokey <pg-primary-pod> -- psql -c "SELECT client_addr, state, replay_lag FROM pg_stat_replication;"

Wichtige Metriken (SLIs)​

Dies sind die Signale, die am wichtigsten sind. Erstellen Sie darauf basierende Grafana-Panels und Warnungen.

Anwendung​

MetrikWarum sie wichtig istGesunder Bereich
Anfragerate (Anf./s)Last / KapazitätBaseline-abhängig
Fehlerrate (5xx %)Zuverlässigkeit< 1 %
P95- / P99-LatenzBenutzererfahrungInnerhalb Ihres SLO
Aktive SitzungenNutzungBaseline-abhängig

Secret-Engine (OpenBao / Vault)​

MetrikGesund
SiegelstatusEntsiegelt bei Quorum
Raft-Leader vorhandenGenau ein Leader
AnfragelatenzStabil, niedrig

PostgreSQL​

MetrikGesund
Replikations-Lag< 30 s
Aktive VerbindungenUnterhalb von max_connections
Festplattenauslastung< 85 %
Verfügbarkeit des PrimaryImmer ein schreibbarer Primary

Plattform​

MetrikGesund
Knoten-CPU / -ArbeitsspeicherReserve wird gehalten
Pod-NeustartsKeine Crash-Loops
PV-Kapazität< 85 % ausgelastet
etcd-ZustandAlle Mitglieder fehlerfrei

Vorgeschlagene SLOs​

Service-Level-ZielZielwert
API-Verfügbarkeit≥ 99,9 % monatlich
API-P95-Latenz≤ Ihr vereinbarter Schwellenwert
Erfolgreiche Backups100 % der geplanten Durchläufe
RTO (Notfallwiederherstellung)Siehe Backup & DR
RPO (Datenverlustfenster)Siehe Backup & DR

Synthetische / Liveness-Prüfungen​

  • Kubernetes-Liveness- und Readiness-Prüfungen sind auf jedem DuoKey-Pod konfiguriert, sodass OpenShift fehlerhafte Instanzen automatisch neu startet oder entfernt.
  • Fügen Sie eine externe synthetische Prüfung (von Ihrem Monitoring-System oder LB-Health-Monitor) gegen die Cockpit-URL hinzu, um durchgängige Fehler zu erkennen.

Warnungen​

Der empfohlene Satz an Warnungen ist dokumentiert unter Monitoring & Observability → Empfohlene Warnungen. Leiten Sie Warnungen an Ihren Bereitschaftskanal weiter (Alertmanager → E-Mail / Slack / PagerDuty / OpsGenie) und an Ihr SIEM zur Korrelation.