Zum Hauptinhalt springen

Fehlerbehebung

Ein symptomgesteuerter Leitfaden für die häufigsten Probleme. Beginnen Sie mit dem täglichen Health Check, um das Problem einzugrenzen, und springen Sie dann zum relevanten Abschnitt.

Erste Triage
oc get pods -n duokey -o wide # was ist nicht Running/Ready?
oc describe pod <pod> -n duokey # Ereignisse am Ende
oc logs <pod> -n duokey --tail=200 # Anwendungsfehler

Pods starten nicht​

SymptomWahrscheinliche UrsacheBehebung
PendingUnzureichende Ressourcen / kein planbarer Knotenoc describe pod prüfen; Kapazität hinzufügen oder Anti-Affinität lockern
CrashLoopBackOffApp-Fehler oder fehlendes Secretoc logs prüfen; überprüfen, ob das ExternalSecret synchronisiert wurde
CreateContainerConfigErrorSecret/ConfigMap fehltBestätigen, dass ESO das Secret erzeugt hat (siehe unten)
ImagePullBackOffRegistry nicht erreichbar / unsigniertes ImageMirror-Registry und Image-Signaturrichtlinie prüfen

Secrets werden nicht injiziert​

oc get externalsecret -n duokey
oc describe externalsecret <name> -n duokey # SecretSyncedError-Ursachen ansehen
oc get secretstore -n duokey
UrsacheBehebung
Authentifizierung am Secret-Manager schlägt fehlKubernetes-Auth-Rolle und ServiceAccount-Zuordnung in Vault/OpenBao/CyberArk überprüfen
OpenBao versiegeltQuorum entsiegeln: bao operator unseal
Pfad / Schlüssel nicht gefundenSecret-Pfad im SecretStore bestätigen und prüfen, ob der Quellwert existiert

Siehe Secret-Manager-Integration.

Datenbankprobleme​

# Replikationszustand
oc exec -n duokey <pg-primary> -- psql -c "SELECT * FROM pg_stat_replication;"
SymptomUrsacheBehebung
Replikat-Lag wächstNetzwerk- / IO-DruckBandbreite und Festplatten-IO auf Replikaten prüfen
Kein Primary / schreibgeschütztFailover läuftDen Operator ein Replikat hochstufen lassen; Quorum überprüfen
Verbindung abgelehntFirewall / max_connectionsFW-Regel (5432) und Verbindungspool prüfen

GitOps / ArgoCD​

argocd app get duokey
argocd app sync duokey # Abgleich erzwingen
argocd app diff duokey # Abweichung ansehen
SymptomUrsacheBehebung
OutOfSyncManuelle Änderung / AbweichungErneut synchronisieren; untersuchen, wer den Cluster-Zustand geändert hat
DegradedFehlerhaftes Manifest / ausfallender PodDie Ressource untersuchen, die ArgoCD als fehlerhaft kennzeichnet
Repo nicht erreichbarGitLab nicht erreichbarFW (443/22) und Anmeldedaten prüfen

Ingress / TLS​

SymptomUrsacheBehebung
503 vom RouterKeine funktionierenden Backend-PodsZuerst die Backend-Pods beheben
ZertifikatsfehlerAbgelaufenes / falsches ZertifikatRoutenzertifikat erneuern/ersetzen
Verbindungs-ResetTLS-Profil / Cipher-UnterschiedtlsSecurityProfile sowie LB-/WAF-Einstellungen anpassen (Netzwerksicherheit)
Blockierte AnfragenWAF-FehlalarmWAF-Regel anpassen; WAF-Logs prüfen

Performance​

  • Prüfen Sie die wichtigen Metriken auf Sättigung (CPU/Arbeitsspeicher, DB-Verbindungen, Latenz).
  • Bestätigen Sie, dass Pods über Knoten/Zonen verteilt sind (Anti-Affinität).
  • Überprüfen Sie HPA / Replikatzahlen, falls die Anfragerate die Kapazität übersteigt.

Notfallwiederherstellung​

Für vollständige oder teilweise Wiederherstellungsverfahren siehe Backup & Notfallwiederherstellung.

Erstellen eines Support-Bundles​

Fügen Sie bei der Eskalation an den DuoKey-Support Folgendes bei:

oc adm must-gather # clusterweite Diagnose
oc get events -n duokey --sort-by=.lastTimestamp
oc logs <failing-pod> -n duokey --previous
argocd app get duokey -o yaml

Senden Sie dies an [email protected] mit einer Beschreibung des Symptoms, dem Zeitverlauf und allen kürzlichen Änderungen.