คอขวดสำคัญของการรันโมเดล AI หรือ Inference ไม่ได้อยู่ที่การคำนวณเพียงอย่างเดียว แต่อยู่ที่การเคลื่อนย้ายข้อมูลด้วย GPU แบบทั่วไป รวมถึง GPU ของ Nvidia ต้องดึงน้ำหนักของโมเดลจากหน่วยความจำแบนด์วิดท์สูง หรือ HBM (High Bandwidth Memory) ไปยังแกนประมวลผลซ้ำแล้วซ้ำเล่า กระบวนการนี้กินทั้งเวลาและพลังงาน จนเกิดสิ่งที่วงการเรียกว่า “กำแพงหน่วยความจำ” หรือ memory wall
Taalas แก้ปัญหานี้ด้วยชิปที่เรียกว่า Model-Specific Integrated Circuit (MSIC) หรือวงจรรวมที่ออกแบบมาเฉพาะสำหรับโมเดลหนึ่ง ๆ โดยบริษัทฝังทั้งโครงสร้างการไหลของข้อมูลและค่าน้ำหนักเชิงตัวเลขของโมเดลลงในลอจิกและชั้นโลหะของชิปตั้งแต่ขั้นตอนการผลิต เมื่อไม่มีการโหลดน้ำหนักจากหน่วยความจำระหว่างทำงาน คอขวดดังกล่าวจึงถูกตัดออกไป
ผลทดสอบที่เผยแพร่ออกมาน่าสนใจอย่างมาก ชิปต้นแบบ HC1 ของ Taalas ซึ่งผลิตด้วยกระบวนการ 6 นาโนเมตรของ TSMC สามารถให้บริการโมเดล Llama 3.1 8B ของ Meta ได้ที่ 16,960 โทเคนต่อวินาที ในเดือนกุมภาพันธ์ 2026 โดยมีการระบุว่าทำได้เร็วกว่า Nvidia GPU ที่ใช้เป็นเกณฑ์เปรียบเทียบสูงสุด 48 เท่า อย่างไรก็ตาม บางแหล่งระบุว่าสูงถึง 73 เท่า ขึ้นอยู่กับรุ่น Nvidia และเกณฑ์ฐานที่นำมาเปรียบเทียบ
จุดแข็งของ MSIC ก็คือข้อจำกัดที่ชัดเจนที่สุดเช่นกัน เพราะน้ำหนักโมเดลถูกฝังอยู่ในตัวชิปตั้งแต่โรงงาน ชิป Taalas หนึ่งตัวจึงสามารถรันได้เฉพาะโมเดลที่ถูกออกแบบมาให้เท่านั้น ไม่สามารถเปลี่ยนไปโหลดโมเดลอื่นเหมือน GPU อเนกประสงค์ได้
เพื่อบรรเทาข้อจำกัดนี้ Taalas พัฒนาเครื่องมือที่ช่วยให้บริษัทปรับแต่งเฉพาะ โลหะสองชั้นบนสุด จากโครงสร้างชิปที่มีประมาณ 100 ชั้น ส่วนการออกแบบเวเฟอร์พื้นฐานยังคงเดิม ทำให้การออกแบบและส่งผลิตชิปสำหรับโมเดลใหม่ใช้เวลาประมาณ สองเดือน เมื่อกำหนดโมเดลเป้าหมายได้แล้ว ซึ่งสั้นกว่าการพัฒนา ASIC แบบดั้งเดิม
AMD วางแผนผสาน MSIC ของ Taalas เข้ากับสถาปัตยกรรมประมวลผลแบบ แยกส่วนและผสมผสาน (disaggregated, heterogeneous compute architecture) ร่วมกับ GPU ตระกูล Instinct และระบบระดับแร็ก Helios
ในแนวทางนี้ Instinct GPU จะยังรับผิดชอบงานฝึกโมเดลและงาน Inference ที่ต้องการความยืดหยุ่น ขณะที่ชิป Taalas จะทำหน้าที่เป็นตัวเร่งเฉพาะทางสำหรับโมเดลที่มีผู้ใช้งานจำนวนมาก โดยเน้นปริมาณงานสูงและความหน่วงต่ำ ส่วนแพลตฟอร์ม Helios จะเชื่อมองค์ประกอบเหล่านี้เข้าด้วยกันผ่านโครงสร้างระดับแร็ก
พูดให้เข้าใจง่ายคือ AMD ไม่ได้พยายามแทนที่ GPU ทั้งหมด แต่กำลังสร้างทางเลือกหลายระดับให้ลูกค้าใช้ GPU สำหรับงานหลากหลายรูปแบบ และใช้ MSIC สำหรับโมเดลยอดนิยมที่ต้องให้บริการซ้ำ ๆ ในปริมาณมหาศาล
AMD ยังไม่เปิดเผยมูลค่าการเข้าซื้อ Taalas ดีลนี้เกิดขึ้นต่อเนื่องจากการซื้อกิจการสำคัญก่อนหน้านี้ ได้แก่ ZT Systems มูลค่า 4.9 พันล้านดอลลาร์สหรัฐ ในเดือนกรกฎาคม 2024 และ Silo AI มูลค่า 665 ล้านดอลลาร์สหรัฐ ในเดือนสิงหาคม 2024
ในเชิงการแข่งขัน การเข้าซื้อ Taalasช่วยให้ AMD เดินเกมในตลาด Inference เพื่อต่อกรกับ Nvidia ได้ชัดเจนขึ้น โดย Nvidia มีรายงานว่าเซ็นข้อตกลงอนุญาตใช้เทคโนโลยีมูลค่า 20,000 ล้านดอลลาร์สหรัฐกับ Groq ในช่วงต้นปี 2026 ซึ่งเปิดทางให้ Nvidia เข้าถึงสถาปัตยกรรม LPU สำหรับงาน Inference ของ Groq
เดิมพันของ AMD คือชิปที่สร้างขึ้นเพื่อโมเดลใดโมเดลหนึ่งโดยเฉพาะ อาจให้ประสิทธิภาพต่อวัตต์ดีกว่าในงานที่มีปริมาณสูงและรูปแบบคงที่ แม้ต้องแลกกับการไม่สามารถสลับโมเดลได้อย่างอิสระ
Taalas ก่อตั้งขึ้นในปี 2023 ที่เมืองโตรอนโต โดย Ljubisa Bajic อดีตซีอีโอของ Tenstorrent ซึ่งเป็นสตาร์ตอัปชิป AI อีกราย พร้อมทีมงานที่มีอดีตวิศวกร AMD รวมอยู่ด้วย
ก่อนถูกซื้อกิจการ บริษัทระดมทุนจากนักลงทุนได้รวม 219 ล้านดอลลาร์สหรัฐ โดยมี Eclipse Ventures, Makers Fund และ Radical Ventures เป็นหนึ่งในผู้ลงทุน
ในเดือนกุมภาพันธ์ 2026 Taalas เปิดตัวการสาธิตชิป HC1 ที่รัน Llama 3.1 8B ด้วยความเร็ว 16,960 โทเคนต่อวินาที ซึ่งเป็นตัวเลขที่ช่วยดึงความสนใจจาก AMD
การเข้าซื้อ Taalas สะท้อนการเดิมพันของ AMD ว่าอนาคตของการให้บริการโมเดล AI อาจไม่ได้ขึ้นอยู่กับการทำให้ GPU อเนกประสงค์เร็วขึ้นเพียงอย่างเดียว แต่อาจรวมถึงชิปเฉพาะทางที่ยอมเสียความยืดหยุ่น เพื่อแลกกับประสิทธิภาพสูงสุดสำหรับโมเดลที่มีความต้องการใช้งานมากที่สุด
การจับคู่ MSIC ของ Taalas กับ Instinct GPU ในระบบแบบแยกส่วน ทำให้ AMD สามารถรองรับทั้งโมเดลหลากหลายประเภทและทราฟฟิกจำนวนมหาศาลจากโมเดลยอดนิยมได้ในแพลตฟอร์มเดียว นี่จึงเป็นการท้าทายโครงสร้างพื้นฐาน Inference ที่มี GPU ของ Nvidia เป็นศูนย์กลางโดยตรง