運用手順(Runbook)テンプレート

オンコール時にアラートを受けてから復旧までを、判断基準つきで書きます。

発火条件

  • アラート: ingestion-lag > 30min
  • 通知先: オンコール担当者の Slack DM
  • 優先度: 中(業務時間外は翌朝対応で可)

切り分け

  1. ダッシュボードでジョブの状態を確認する
  2. 失敗ジョブがあればログのエラーを確認する
  3. データソース側の障害情報を確認する

復旧手順

  1. 失敗ジョブの再実行を依頼する
  2. 取り込みが追いつくまで待機する(目安 10 分)
  3. 遅延が解消したことをダッシュボードで確認する
  4. 原因と対応を log.md に記録する

関連