近期,雲端服務的故障似乎已成為常態,連「九九九」的可用性目標都顯得遙不可及。

GitHub 在本月至今的表現可謂跌跌撞撞。2 月 9 日,其 Actions、提取請求(pull requests)、通知(notifications)以及 Copilot 等服務均出現了問題。微軟旗下這個程式碼託管平台最初於 UTC 時間 15:54 承認「部分 GitHub 服務」出現問題,隨後又坦承通知延遲了「約 50 分鐘」。

直到 UTC 時間 19:29,公司才確認服務已恢復正常,儘管在 UTC 時間 17:57 時,延遲時間已縮短至「約 30 分鐘」。

其旗艦技術之一 Copilot 也未能倖免。從 2 月 9 日 UTC 時間 16:29 到 2 月 10 日 UTC 時間 09:57,GitHub 回報稱部分用戶的 Copilot 政策傳播出現問題。該平台表示:「這可能會阻止用戶在嘗試存取時,看到新啟用(或更新)的模型。」

類似的狀況層出不窮。GitHub 在一段時間前更改了其狀態頁面,使得視覺化服務可用性變得更加困難。雖然詳細資訊仍然顯眼,但要掌握過去 90 天的整體運行狀況,特別是總體正常運行時間,變得更加棘手。

這個「遺失」的狀態頁面可以透過公開的狀態饋送(public status feed)以重建的形式找到,但由於這是非官方來源,需要謹慎對待。該饋送顯示 GitHub 的穩定性一直不佳:在 2025 年的某個時間點,正常運行時間曾跌破 90%。

GitHub 並非唯一面臨服務不穩定困境的公司。雖然「五九」(99.999% 的正常運行時間)是業界的黃金標準,但有些供應商連維持 90% 的正常運行時間都感到吃力——這對依賴這些平台的客戶來說是一個嚴重的擔憂。

GitHub 的企業雲客戶服務等級協議(SLA)承諾 99.9% 的正常運行時間,但該公司並未對所有用戶提供此保證。

GitHub 客戶的這些困境凸顯了規劃應對服務中斷與確保服務正常運行同樣重要的必要性。