Fehlerbehebung
Ein symptomgesteuerter Leitfaden für die häufigsten Probleme. Beginnen Sie mit dem täglichen Health Check, um das Problem einzugrenzen, und springen Sie dann zum relevanten Abschnitt.
Erste Triage
oc get pods -n duokey -o wide # was ist nicht Running/Ready?
oc describe pod <pod> -n duokey # Ereignisse am Ende
oc logs <pod> -n duokey --tail=200 # Anwendungsfehler
Pods starten nicht
| Symptom | Wahrscheinliche Ursache | Behebung |
|---|---|---|
Pending | Unzureichende Ressourcen / kein planbarer Knoten | oc describe pod prüfen; Kapazität hinzufügen oder Anti-Affinität lockern |
CrashLoopBackOff | App-Fehler oder fehlendes Secret | oc logs prüfen; überprüfen, ob das ExternalSecret synchronisiert wurde |
CreateContainerConfigError | Secret/ConfigMap fehlt | Bestätigen, dass ESO das Secret erzeugt hat (siehe unten) |
ImagePullBackOff | Registry nicht erreichbar / unsigniertes Image | Mirror-Registry und Image-Signaturrichtlinie prüfen |
Secrets werden nicht injiziert
oc get externalsecret -n duokey
oc describe externalsecret <name> -n duokey # SecretSyncedError-Ursachen ansehen
oc get secretstore -n duokey
| Ursache | Behebung |
|---|---|
| Authentifizierung am Secret-Manager schlägt fehl | Kubernetes-Auth-Rolle und ServiceAccount-Zuordnung in Vault/OpenBao/CyberArk überprüfen |
| OpenBao versiegelt | Quorum entsiegeln: bao operator unseal |
| Pfad / Schlüssel nicht gefunden | Secret-Pfad im SecretStore bestätigen und prüfen, ob der Quellwert existiert |
Siehe Secret-Manager-Integration.
Datenbankprobleme
# Replikationszustand
oc exec -n duokey <pg-primary> -- psql -c "SELECT * FROM pg_stat_replication;"
| Symptom | Ursache | Behebung |
|---|---|---|
| Replikat-Lag wächst | Netzwerk- / IO-Druck | Bandbreite und Festplatten-IO auf Replikaten prüfen |
| Kein Primary / schreibgeschützt | Failover läuft | Den Operator ein Replikat hochstufen lassen; Quorum überprüfen |
| Verbindung abgelehnt | Firewall / max_connections | FW-Regel (5432) und Verbindungspool prüfen |
GitOps / ArgoCD
argocd app get duokey
argocd app sync duokey # Abgleich erzwingen
argocd app diff duokey # Abweichung ansehen
| Symptom | Ursache | Behebung |
|---|---|---|
OutOfSync | Manuelle Änderung / Abweichung | Erneut synchronisieren; untersuchen, wer den Cluster-Zustand geändert hat |
Degraded | Fehlerhaftes Manifest / ausfallender Pod | Die Ressource untersuchen, die ArgoCD als fehlerhaft kennzeichnet |
| Repo nicht erreichbar | GitLab nicht erreichbar | FW (443/22) und Anmeldedaten prüfen |
Ingress / TLS
| Symptom | Ursache | Behebung |
|---|---|---|
| 503 vom Router | Keine funktionierenden Backend-Pods | Zuerst die Backend-Pods beheben |
| Zertifikatsfehler | Abgelaufenes / falsches Zertifikat | Routenzertifikat erneuern/ersetzen |
| Verbindungs-Reset | TLS-Profil / Cipher-Unterschied | tlsSecurityProfile sowie LB-/WAF-Einstellungen anpassen (Netzwerksicherheit) |
| Blockierte Anfragen | WAF-Fehlalarm | WAF-Regel anpassen; WAF-Logs prüfen |
Performance
- Prüfen Sie die wichtigen Metriken auf Sättigung (CPU/Arbeitsspeicher, DB-Verbindungen, Latenz).
- Bestätigen Sie, dass Pods über Knoten/Zonen verteilt sind (Anti-Affinität).
- Überprüfen Sie HPA / Replikatzahlen, falls die Anfragerate die Kapazität übersteigt.
Notfallwiederherstellung
Für vollständige oder teilweise Wiederherstellungsverfahren siehe Backup & Notfallwiederherstellung.
Erstellen eines Support-Bundles
Fügen Sie bei der Eskalation an den DuoKey-Support Folgendes bei:
oc adm must-gather # clusterweite Diagnose
oc get events -n duokey --sort-by=.lastTimestamp
oc logs <failing-pod> -n duokey --previous
argocd app get duokey -o yaml
Senden Sie dies an [email protected] mit einer Beschreibung des Symptoms, dem Zeitverlauf und allen kürzlichen Änderungen.