メインコンテンツまでスキップ

ヘルスチェックとメトリクス

このページは、運用チームに具体的なチェックと監視すべき主要メトリクスを提供します。 監視とオブザーバビリティスタックの概要を補完するものです。

日次ヘルスチェック (5 分)​

以下のコマンドを実行して、プラットフォームが正常であることを確認します:

# 1. All DuoKey pods Running/Ready and spread across nodes
oc get pods -n duokey -o wide

# 2. Cluster operators healthy
oc get clusteroperators | grep -vi "True.*False.*False"

# 3. Ingress route serving TLS
oc get route -n duokey
curl -I https://cockpit.duokey.example.local

# 4. Secrets being injected (no plaintext on disk)
oc get externalsecret -n duokey

# 5. GitOps in sync
argocd app get duokey | grep -E "Sync Status|Health Status"

# 6. PersistentVolume usage
oc get pvc -A

外部 / VM 層:

# OpenBao: must be unsealed with an active Raft leader
bao status

# PostgreSQL: primary up, replicas streaming, low lag
oc exec -n duokey <pg-primary-pod> -- psql -c "SELECT client_addr, state, replay_lag FROM pg_stat_replication;"

主要メトリクス (SLI)​

これらは最も重要なシグナルです。これらを基に Grafana パネルとアラートを構築してください。

アプリケーション​

メトリクス重要性正常範囲
リクエストレート (req/s)負荷 / キャパシティベースライン依存
エラーレート (5xx %)信頼性1% 未満
P95 / P99 レイテンシユーザーエクスペリエンスSLO の範囲内
アクティブセッション使用状況ベースライン依存

シークレットエンジン (OpenBao / Vault)​

メトリクス正常
封印ステータスクォーラムで封印解除済み
Raft リーダーの存在ちょうど 1 つのリーダー
リクエストレイテンシ安定して低い

PostgreSQL​

メトリクス正常
レプリケーション遅延30 秒未満
アクティブ接続数max_connections 未満
ディスク使用率85% 未満
プライマリの可用性常に書き込み可能なプライマリが 1 つ

プラットフォーム​

メトリクス正常
ノード CPU / メモリヘッドルームを維持
Pod 再起動クラッシュループなし
PV 容量使用率 85% 未満
etcd の健全性全メンバーが正常

推奨 SLO​

サービスレベル目標ターゲット
API 可用性月次 99.9% 以上
API P95 レイテンシ合意したしきい値以下
バックアップ成功スケジュールされた実行の 100%
RTO (災害復旧)バックアップと DR を参照
RPO (データ損失ウィンドウ)バックアップと DR を参照

合成 / 稼働状態プローブ​

  • Kubernetes の liveness および readiness プローブが各 DuoKey Pod に設定されており、 OpenShift が正常でないインスタンスを自動的に再起動または削除します。
  • Cockpit URL に対する外部合成チェック (監視システムまたは LB ヘルスモニターから) を 追加して、エンドツーエンドの障害を検出します。

アラート​

推奨アラートセットは 監視とオブザーバビリティ → 推奨アラート に記載されています。アラートをオンコールチャネル (Alertmanager → メール / Slack / PagerDuty / OpsGenie) と、相関のための SIEM にルーティングしてください。