GitHub แจงเหตุระบบล่ม 7 ชั่วโมง ปมทราฟฟิกพุ่งทะลุขีดจำกัด

GitHub ได้ออกมาให้ข้อมูลเพิ่มเติมเกี่ยวกับเหตุการณ์ระบบล่มเป็นเวลานานถึง 7 ชั่วโมง เมื่อวันที่ 17 สิงหาคม 2026 ที่ผ่านมา โดยระบุว่าปัญหาดังกล่าวไม่ได้เกิดจากความผิดพลาดในการตั้งค่าคอนฟิก Istio เพียงอย่างเดียว แต่เป็นปัญหาเชิงโครงสร้างพื้นฐานที่รองรับการขยายตัวไม่ทัน
วิกฤตทราฟฟิกพุ่งสูงทำระบบรับไม่ไหว
Vlad Fedorov ซีทีโอของ GitHub อธิบายว่า เหตุการณ์นี้เป็นผลกระทบต่อเนื่องจากการที่ทราฟฟิกของแพลตฟอร์มเพิ่มขึ้นอย่างก้าวกระโดดนับตั้งแต่ช่วงเดือนเมษายนที่ผ่านมา โดยในวันที่ 17 สิงหาคม ปริมาณการใช้งานได้สร้างสถิติสูงสุดใหม่จนทำให้โครงสร้างพื้นฐานในศูนย์ข้อมูลเขต Central US ไม่สามารถรองรับภาระงานได้ ส่งผลให้ระบบอื่นๆ ที่เชื่อมโยงกันเกิดการล่มตามไปด้วย
สถิติการใช้งานเพิ่มขึ้นกว่า 2 เท่า
ข้อมูลจากทาง GitHub ระบุตัวเลขที่น่าสนใจว่า จำนวนการ commit ต่อเดือนได้เพิ่มสูงขึ้นจาก 1.4 พันล้านครั้งในเดือนเมษายน มาอยู่ที่ 2.9 พันล้านครั้งในเดือนสิงหาคม 2026 ซึ่ง Fedorov ยืนยันว่าเหตุการณ์นี้ไม่ใช่ปัญหาจากโค้ดหรือการตั้งค่าที่ผิดพลาด แต่เป็นปัญหาจากขีดความสามารถของระบบ (capacity failure) ที่ขยายตัวไม่ทันต่อความต้องการใช้งานจริง
ความยากลำบากในการกู้คืนระบบ
กระบวนการกู้คืนระบบเป็นไปอย่างยากลำบากเนื่องจากสถาปัตยกรรมของ GitHub มีความเชื่อมโยงกันสูง ทีมงานจำเป็นต้องตัดทราฟฟิกในส่วนที่มีปัญหาออกก่อน แล้วจึงค่อยๆ ฟื้นฟูบริการทีละส่วน อย่างไรก็ตาม ในระหว่างการกู้คืนได้เกิดปัญหาซ้ำซ้อนขึ้น เมื่อไคลเอนต์จำนวนมากพยายามเชื่อมต่อเข้ามายังบริการที่ยังไม่พร้อม ส่งผลให้เกิดปริมาณทราฟฟิกหนาแน่นขึ้นอีกในระหว่างที่ระบบกำลังพยายามกลับมาทำงานตามปกติ
