415.tech
シリコンバレー発、AIとテックの最前線
GitHub、7時間47分の障害原因はデプロイ不良ではなく記録的トラフィック

GitHub、7時間47分の障害原因はデプロイ不良ではなく記録的トラフィック

GitHubの障害報告書によると、8月17日に発生したActions、プルリクエスト、Issue、Copilot、APIに及ぶ7時間47分の障害は、コードや設定の変更ではなく、米国中部のコンポーネントのスケール不足が原因だった。問題の核心はトラフィックにある。月間コミット数は4月の14億件から29億件へと増加し、さらに2400万件の新規リポジトリが追加された上、VS Codeのリトライ挙動が障害を増幅させた。CTOのVladimir Fedorovが挙げた再発防止策(重要システムの分離、リトライ制限の強化、トラフィック急増時のアラート)は、パフォーマンスが低下したAPIに対して自動リトライを行うあらゆるツールで再現しうる「リトライストーム」による障害モードを浮き彫りにしている。

出典: theregister.com

Xでポストメール

なぜ重要か

  • → トラフィックの急増(4月から2倍)がインフラを圧倒し、コードの欠陥ではなかった。
  • → リトライストームが、依存するシステム全体にわたる連鎖的な障害を増幅させる。
  • → 開発者向けツールの統合が進むにつれて、より広範なプラットフォームのスケーリング課題を示唆する。
Scaleがdeploymentを打ち破る
このエディションの他の記事