監視とオブザーバビリティ
この展開には、軽量かつ高密度なオブザーバビリティスタックが付属しており、運用チームは プラットフォームとアプリケーションの両方を完全に可視化できます。
スタック
| 関心事 | ツール | 役割 |
|---|---|---|
| メトリクス | vmagent → VictoriaMetrics | 名前空間全体のパフォーマンスエンドポイントをスクレイプし、分散ストア (vmstorage、vminsert、vmselect) に格納します。 |
| ログ | Vector → VictoriaLogs | stdout/stderr を収集し、構造化検索のために転送します。 |
| ダッシュボード | Grafana | VictoriaMetrics と VictoriaLogs をデータソースとして接続します。 |
監視対象
- アプリケーションの健全性 — Cockpit フロントエンドと Rust API バックエンドの リクエストレート、エラーレート、レイテンシ。
- OpenBao — 封印ステータス、Raft リーダーシップ、リクエストスループット。封印解除済みで 正常なクォーラムが重要です。
- PostgreSQL — プライマリおよびレプリカのレプリケーション遅延、接続数、ディスク使用率。
- Redis — クラスターの健全性とマスター/レプリカのフェイルオーバーイベント。
- プラットフォーム — ノードの CPU/メモリ、Pod の再起動、PersistentVolume の容量。
推奨アラート
| アラート | 条件 |
|---|---|
| OpenBao 封印 | いずれかの OpenBao ノードが sealed = true を報告 |
| PostgreSQL レプリカ遅延 | 遅延が 30 秒を超えて 5 分以上継続 |
| Pod クラッシュループ | いずれかの DuoKey Pod が 10 分間に 3 回を超えて再起動 |
| Ingress 5xx | 5xx レートが 5 分間で 1% を超過 |
| PV ほぼ満杯 | いずれかの PersistentVolume の使用率が 85% を超過 |
| バックアップ失敗 | Velero のスケジュールされたバックアップが正常に完了しなかった |
ダッシュボードへのアクセス
Grafana は duokey-observability 名前空間の OpenShift ルート経由で公開されています:
oc get route grafana -n duokey-observability
配信パッケージに含まれる DuoKey ダッシュボードをインポートするか、 VictoriaMetrics/VictoriaLogs データソースの上に独自のダッシュボードを構築してください。