
GitHub、7時間47分の障害原因はデプロイ不良ではなく記録的トラフィック
GitHubの障害報告書によると、8月17日に発生したActions、プルリクエスト、Issue、Copilot、APIに及ぶ7時間47分の障害は、コードや設定の変更ではなく、米国中部のコンポーネントのスケール不足が原因だった。問題の核心はトラフィックにある。月間コミット数は4月の14億件から29億件へと増加し、さらに2400万件の新規リポジトリが追加された上、VS Codeのリトライ挙動が障害を増幅させた。CTOのVladimir Fedorovが挙げた再発防止策(重要システムの分離、リトライ制限の強化、トラフィック急増時のアラート)は、パフォーマンスが低下したAPIに対して自動リトライを行うあらゆるツールで再現しうる「リトライストーム」による障害モードを浮き彫りにしている。
出典: theregister.com ↗
なぜ重要か
- → トラフィックの急増(4月から2倍)がインフラを圧倒し、コードの欠陥ではなかった。
- → リトライストームが、依存するシステム全体にわたる連鎖的な障害を増幅させる。
- → 開発者向けツールの統合が進むにつれて、より広範なプラットフォームのスケーリング課題を示唆する。
Scaleがdeploymentを打ち破る