Aller au contenu principal

Dépannage

Un guide orienté symptômes pour les problèmes les plus courants. Commencez par le contrôle de santé quotidien pour localiser le problème, puis passez à la section pertinente.

Premier tri
oc get pods -n duokey -o wide # qu'est-ce qui n'est pas Running/Ready ?
oc describe pod <pod> -n duokey # événements en bas
oc logs <pod> -n duokey --tail=200 # erreurs applicatives

Pods qui ne démarrent pas​

SymptômeCause probableRésolution
PendingRessources insuffisantes / aucun nœud planifiableVérifier oc describe pod ; ajouter de la capacité ou assouplir l'anti-affinité
CrashLoopBackOffErreur applicative ou secret manquantVérifier oc logs ; confirmer que l'ExternalSecret s'est synchronisé
CreateContainerConfigErrorSecret/ConfigMap manquantConfirmer qu'ESO a produit le Secret (ci-dessous)
ImagePullBackOffRegistre inaccessible / image non signéeVérifier le registre miroir et la politique de signature d'image

Secrets non injectés​

oc get externalsecret -n duokey
oc describe externalsecret <name> -n duokey # voir les raisons SecretSyncedError
oc get secretstore -n duokey
CauseRésolution
Échec de l'authentification auprès du gestionnaire de secretsVérifier le rôle d'authentification Kubernetes et le mappage du ServiceAccount dans Vault/OpenBao/CyberArk
OpenBao scelléDéverrouiller le quorum : bao operator unseal
Chemin / clé introuvableConfirmer le chemin du secret dans le SecretStore et que la valeur source existe

Voir Intégration du gestionnaire de secrets.

Problèmes de base de données​

# Santé de la réplication
oc exec -n duokey <pg-primary> -- psql -c "SELECT * FROM pg_stat_replication;"
SymptômeCauseRésolution
Latence de réplica croissantePression réseau / IOVérifier la bande passante et l'IO disque sur les réplicas
Pas de primaire / en lecture seuleBasculement en coursLaisser l'opérateur promouvoir un réplica ; vérifier le quorum
Connexion refuséePare-feu / max_connectionsVérifier la règle FW (5432) et le pool de connexions

GitOps / ArgoCD​

argocd app get duokey
argocd app sync duokey # forcer la réconciliation
argocd app diff duokey # voir la dérive
SymptômeCauseRésolution
OutOfSyncChangement manuel / dériveResynchroniser ; enquêter sur qui a modifié l'état du cluster
DegradedMauvais manifeste / pod défaillantInspecter la ressource qu'ArgoCD signale comme non saine
Impossible d'atteindre le dépôtGitLab inaccessibleVérifier le FW (443/22) et les identifiants

Ingress / TLS​

SymptômeCauseRésolution
503 depuis le routeurAucun pod backend sainCorriger d'abord les pods backend
Erreur de certificatCertificat expiré / incorrectRenouveler/remplacer le certificat de la route
Réinitialisation de la connexionIncompatibilité de profil TLS / de suite de chiffrementAligner tlsSecurityProfile et les paramètres LB/WAF (Sécurité réseau)
Requêtes bloquéesFaux positif du WAFAjuster la règle WAF ; vérifier les journaux WAF

Performance​

  • Vérifiez les métriques clés pour la saturation (CPU/mémoire, connexions BD, latence).
  • Confirmez que les pods sont répartis sur les nœuds/zones (anti-affinité).
  • Revoyez les comptes HPA / de réplicas si le débit de requêtes dépasse la capacité.

Reprise après sinistre​

Pour les procédures de restauration complète ou partielle, voir Sauvegarde et reprise après sinistre.

Collecter un bundle de support​

Lors d'une escalade vers le support DuoKey, joignez :

oc adm must-gather # diagnostics à l'échelle du cluster
oc get events -n duokey --sort-by=.lastTimestamp
oc logs <failing-pod> -n duokey --previous
argocd app get duokey -o yaml

Envoyez à [email protected] avec une description du symptôme, la chronologie et tout changement récent.