AMD จับมือ Cerebras พัฒนาโซลูชันรัน LLM ประสิทธิภาพสูง รองรับการประมวลผลยุคใหม่

AMD จับมือ Cerebras พัฒนาโซลูชันรัน LLM ประสิทธิภาพสูง
AMD ประกาศความร่วมมือครั้งสำคัญกับ Cerebras ในการพัฒนาโซลูชันสำหรับการรันโมเดลภาษาขนาดใหญ่ (LLM) ด้วยเทคนิคแบบ disaggregated inference เพื่อเพิ่มประสิทธิภาพในการให้บริการโทเค็น (token) ให้มีความรวดเร็วและรองรับปริมาณงานที่สูงขึ้น
ทำความเข้าใจการประมวลผล LLM
โดยปกติแล้ว การประมวลผลของ LLM จะถูกแบ่งออกเป็น 2 ช่วงหลัก ได้แก่:
- Prompt processing: เป็นช่วงที่ต้องการพลังในการประมวลผลสูงสุด ซึ่งชิปกราฟิก (GPU) มีความได้เปรียบอย่างมากในด้านนี้
- Decoding: เป็นช่วงที่ต้องการแบนด์วิดท์หน่วยความจำ (Memory Bandwidth) สูงเป็นพิเศษ
จุดเด่นของชิปจาก Cerebras
ทางด้าน Cerebras ได้นำเสนอชิป Wafer Scale Engine ที่มีความโดดเด่นด้วยการติดตั้งหน่วยความจำความเร็วสูงแบบ SRAM ลงบนเวเฟอร์ชิปโดยตรง แม้จะมีต้นทุนการผลิตที่ค่อนข้างสูง แต่ก็สามารถสร้างแบนด์วิดท์หน่วยความจำได้มหาศาลถึง 21PB/s ซึ่งถือเป็นโซลูชันที่เหมาะสมอย่างยิ่งสำหรับการประมวลผลในช่วง decoding
ความเคลื่อนไหวของคู่แข่งในตลาด
ในขณะที่ตลาดการประมวลผล AI มีการแข่งขันที่เข้มข้น ทางฝั่งของ NVIDIA ได้ดำเนินการเข้าซื้อกิจการ Groq 3 มาตั้งแต่ช่วงปลายปี 2025 ที่ผ่านมา ปัจจุบันแพลตฟอร์ม Vera Rubin ของ NVIDIA ได้เริ่มวางจำหน่ายพร้อมชุดคู่กับ Groq 3 แล้ว และมีแผนที่จะยกระดับการเชื่อมต่อระหว่างสองเทคโนโลยีนี้ให้มีความใกล้ชิดและแน่นแฟ้นยิ่งขึ้นในปีหน้า
