運用手順(Runbook)テンプレート
オンコール時にアラートを受けてから復旧までを、判断基準つきで書きます。
発火条件
- アラート:
ingestion-lag > 30min - 通知先: オンコール担当者の Slack DM
- 優先度: 中(業務時間外は翌朝対応で可)
切り分け
- ダッシュボードでジョブの状態を確認する
- 失敗ジョブがあればログのエラーを確認する
- データソース側の障害情報を確認する
復旧手順
- 失敗ジョブの再実行を依頼する
- 取り込みが追いつくまで待機する(目安 10 分)
- 遅延が解消したことをダッシュボードで確認する
- 原因と対応を
log.mdに記録する