การประกาศครั้งนี้ชี้ให้เห็นว่า Microsoft กำลังใช้กลยุทธ์แบบสองผู้ขาย โดยวาง AMD Helios ไว้คู่กับแร็ก Nvidia Vera Rubin NVL72 แทนที่จะฝากโครงสร้างพื้นฐาน AI รุ่นถัดไปไว้กับผู้ผลิตเพียงรายเดียว
เหตุผลหลักคือการลดความเสี่ยงด้านซัพพลายเชนและหลีกเลี่ยงการผูกติดกับแพลตฟอร์มของผู้ขายรายเดียว แนวทางนี้สอดคล้องกับท่าทีที่ Microsoft พยายามรักษาความยืดหยุ่นในการเลือกโมเดลและฮาร์ดแวร์บน Azure รวมถึงใน Copilot
Satya Nadella ซีอีโอของ Microsoft ระบุว่า Azure จะเป็นหนึ่งในผู้ให้บริการคลาวด์รายแรก ๆ ที่นำโครงสร้างพื้นฐาน AI แบบแร็กยุคใหม่ ซึ่งอาศัยทั้ง AMD Helios และ Nvidia Vera Rubin มาใช้งาน ในทางปฏิบัติ การมีทางเลือกจากสองค่ายช่วยให้ Microsoft ต่อรองได้มากขึ้น และยังมีแผนสำรองหากผู้ผลิตรายใดรายหนึ่งประสบปัญหาด้านกำลังการผลิตหรือการจัดสรรสินค้า
อุตสาหกรรมจึงมองกลยุทธ์นี้ว่าเป็นการ “กระจายความเสี่ยง” หรือ hedging bets ในการจัดซื้อโครงสร้างพื้นฐาน AI
ทั้ง AMD และ Microsoft ยังไม่ได้เปิดเผยราคาจำหน่ายหรือมูลค่าดีลที่แน่นอน ตัวเลขต่อไปนี้เป็นการประเมินของ Futurum Group
เมื่อเทียบแบบแร็กต่อแร็ก Helios จึงมีราคาสูงกว่าประมาณ 40% ส่วนต่างนี้สะท้อนความจุหน่วยความจำที่สูงกว่า สถาปัตยกรรมแบบเปิด และการรวมชิปประมวลผล GPU, CPU และระบบเครือข่ายของ AMD ไว้ในแพลตฟอร์มเดียว
แม้ต้นทุนเริ่มต้นของ Helios จะสูงกว่า แต่ AMD ระบุว่าระบบของตนคุ้มค่ากว่าเมื่อวัดจากปริมาณงานอนุมานที่ทำได้ต่อเงินลงทุน โดยข้อมูลจากการทดสอบในห้องปฏิบัติการของ AMD ระบุว่า Helios ให้ผลลัพธ์ดังนี้
Lisa Su ซีอีโอของ AMD นำเสนอตัวเลขเหล่านี้ในงาน Advancing AI 2026 โดยกล่าวว่า Helios ให้ประสิทธิภาพมากกว่าคู่แข่งอย่างน้อย 15% ในโมเดลขนาดใหญ่ มีความจุ HBM มากกว่า 50% และให้โทเคนต่อดอลลาร์มากขึ้นสูงสุด 30%
อย่างไรก็ตาม ตัวเลขดังกล่าวยังเป็นการประเมินก่อนผลิตภัณฑ์คู่แข่งจะวางจำหน่ายจริง Futurum Group เตือนว่า ข้อได้เปรียบด้านประสิทธิภาพ 15% และคำเคลมเรื่องโทเคนต่อดอลลาร์ 30% ยังเป็นการคำนวณของผู้ขายเมื่อเทียบกับคู่แข่งที่ยังไม่จัดส่ง และจะต้องพิสูจน์ด้วยการใช้งานจริงภายในสองไตรมาส
AMD Helios เป็นระบบ AI แบบแร็กที่ออกแบบมาสำหรับการประมวลผลขนาดใหญ่ ใช้ระบบระบายความร้อนด้วยของเหลว และรวมองค์ประกอบสำคัญของแพลตฟอร์ม AMD ไว้ด้วยกัน
| องค์ประกอบ | รายละเอียด |
|---|---|
| GPU | AMD Instinct MI455X จำนวน 72 ตัว |
| สถาปัตยกรรม GPU | CDNA 5 ผลิตด้วยชิปเล็ตกระบวนการ 2 นาโนเมตรและ 3 นาโนเมตรที่ TSMC |
| ทรานซิสเตอร์ต่อ GPU | 320,000 ล้านตัว |
| CPU | AMD EPYC Venice รุ่นที่ 6 จำนวน 18 ตัว หรือหนึ่งตัวต่อถาดประมวลผล |
| ระบบเครือข่าย | AMD Pensando Vulcano 800 AI NIC, Ethernet 800 Gbps และแบนด์วิดท์ขยายระบบได้สูงสุด 2.4 Tbps ต่อ GPU |
| การเชื่อมต่อภายในแร็ก | UALink หรือ Ultra Accelerator Link ที่ทำงานผ่าน Ethernet |
| การเชื่อมต่อระหว่างแร็ก | สอดคล้องกับแนวทางของ Ultra Ethernet Consortium (UEC) |
| หน่วยความจำ HBM4 รวม | 31 TB ต่อแร็ก |
| หน่วยความจำต่อ GPU | 432 GB จาก HBM4 จำนวน 12 สแต็ก สแต็กละ 36 GB |
| แบนด์วิดท์หน่วยความจำต่อ GPU | 19.6 TB/s |
| แบนด์วิดท์หน่วยความจำรวม | 1.7 PB/s ต่อแร็ก |
| ประสิทธิภาพ FP4 | 2.9 exaFLOPS ต่อแร็ก |
| ประสิทธิภาพ FP8 | 1.4 exaFLOPS ต่อแร็ก |
| แบนด์วิดท์การขยายระบบภายในแร็ก | 260 TB/s |
| แบนด์วิดท์การขยายระบบระหว่างแร็ก | 43 TB/s |
| รูปแบบตัวเครื่อง | ถาดประมวลผลระบายความร้อนด้วยของเหลว 18 ถาด ถาดละ 4 GPU พร้อมถาดสวิตช์ 6 ถาด ตามมาตรฐาน OCP Open Rack Wide |
| ประสิทธิภาพต่อ GPU | 40 PFLOPS ใน FP4 และ 20 PFLOPS ใน FP8 |
ในแต่ละถาดประมวลผลจะมี MI455X จำนวน 4 ตัว จับคู่กับซีพียู EPYC Venice หนึ่งตัวและระบบเครือข่าย Pensando จากนั้นเชื่อมต่อ GPU ทั้งหมดผ่าน UALink ทำให้ GPU ทั้ง 72 ตัวทำงานเสมือนเป็นหน่วยประมวลผลเดียวกัน
นอกเหนือจาก Microsoft แล้ว AMD ระบุหรือมีรายงานถึงลูกค้ากลุ่มแรกของ Helios ดังต่อไปนี้
ส่วน Anthropic ยังไม่ได้รับการระบุชื่ออย่างเปิดเผยว่าเป็นลูกค้ากลุ่มแรกของ Helios ในประกาศสำคัญที่เผยแพร่ต่อสาธารณะ ณ เดือนกรกฎาคม 2026
การตัดสินใจของ Microsoft สะท้อนว่าการแข่งขันฮาร์ดแวร์ AI กำลังขยับจากการเลือก GPU เพียงรุ่นเดียว ไปสู่การเลือกระบบระดับแร็กทั้งชุด ซึ่งรวม GPU, CPU, หน่วยความจำ การเชื่อมต่อ และซอฟต์แวร์เข้าด้วยกัน
การใช้ทั้ง Helios และ Vera Rubin ยังแสดงให้เห็นว่าผู้ให้บริการคลาวด์รายใหญ่กำลังให้ความสำคัญกับความหลากหลายของแพลตฟอร์ม เพื่อรักษาซัพพลาย เพิ่มอำนาจต่อรอง และเลือกใช้จุดเด่นของแต่ละระบบให้เหมาะกับงาน
Helios อาจเหมาะกับงานอนุมานขนาดใหญ่เป็นพิเศษ เพราะมี HBM4 รวม 31 TB และแบนด์วิดท์สูง ซึ่งเป็นปัจจัยสำคัญต่อปริมาณโทเคนที่ประมวลผลได้และต้นทุนต่อโทเคน แต่คำตอบสุดท้ายยังต้องรอการจัดส่งในช่วงครึ่งหลังของปี 2026 และผลทดสอบจากระบบที่ทำงานจริงในระดับการผลิต