यह सौदा AI के inference बाजार में AMD की महत्वाकांक्षा को दिखाता है। Inference का मतलब है—पहले से प्रशिक्षित AI मॉडल का उपयोग करके यूज़र के सवालों के जवाब या अन्य आउटपुट तैयार करना।
पारंपरिक GPU सिस्टम में AI मॉडल के वेट्स आम तौर पर High Bandwidth Memory यानी HBM में रखे जाते हैं। हर बार जब मॉडल कोई नया टोकन बनाता है, तो इन वेट्स को मेमोरी से कंप्यूटिंग कोर तक ले जाना पड़ता है। इस डेटा आवाजाही में काफी समय और ऊर्जा खर्च होती है। इसी समस्या को अक्सर “मेमोरी वॉल” कहा जाता है।
Taalas इसका समाधान Model-Specific Integrated Circuit (MSIC) के जरिए करती है। इन चिप्स में मॉडल का डेटा-फ्लो आर्किटेक्चर और उसके संख्यात्मक वेट्स, दोनों को निर्माण के दौरान चिप की लॉजिक और मेटल लेयर्स में ही शामिल कर दिया जाता है। इसलिए रनटाइम पर मॉडल वेट्स को HBM से बार-बार पढ़ने की जरूरत नहीं पड़ती।
इसका शुरुआती प्रदर्शन प्रभावशाली रहा है। Taalas के HC1 टेस्ट चिप को TSMC की 6nm प्रक्रिया पर बनाया गया था। फरवरी 2026 में इसने Meta के Llama 3.1 8B मॉडल को 16,960 टोकन प्रति सेकंड की गति से चलाने का प्रदर्शन किया। कंपनी और संबंधित रिपोर्टों के अनुसार, यह समान काम करने वाले Nvidia GPU की तुलना में 48 गुना तक तेज़ था। कुछ तुलनाओं में Nvidia के अलग बेसलाइन के आधार पर यह अंतर 73 गुना तक बताया गया है।
Taalas की सबसे बड़ी ताकत ही उसकी सबसे बड़ी सीमा भी है। चूंकि मॉडल के वेट्स चिप में भौतिक रूप से शामिल होते हैं, इसलिए हर चिप केवल उसी एक मॉडल को चला सकती है जिसके लिए उसे बनाया गया है। उस पर कोई दूसरा AI मॉडल लोड नहीं किया जा सकता।
इसका अर्थ है कि Taalas चिप सामान्य उपयोग के लिए GPU का विकल्प नहीं है। जिन कंपनियों को कई अलग-अलग मॉडल, लगातार बदलते मॉडल या नए प्रयोग चलाने होते हैं, उनके लिए लचीले GPU अब भी उपयोगी रहेंगे। लेकिन किसी बेहद लोकप्रिय और स्थिर मॉडल पर भारी मात्रा में inference ट्रैफिक हो, तो विशेष चिप का फायदा अधिक हो सकता है।
Taalas ने इस कठोरता को कम करने के लिए अपना विशेष डिजाइन टूलचेन विकसित किया है। लगभग 100 लेयर्स वाले चिप स्टैक में कंपनी केवल ऊपर की दो मेटल लेयर्स को अंतिम रूप देती है। इससे नए मॉडल के लिए चिप डिजाइन को लगभग दो महीने में tape-out तक पहुंचाने का दावा किया गया है। मूल बेस-वेफर डिजाइन को बनाए रखने से पारंपरिक ASIC विकास की तुलना में नए संस्करण तैयार करना तेज़ हो सकता है।
AMD का लक्ष्य Taalas MSICs को अपनी Instinct GPUs और Helios rack-scale systems के साथ एक disaggregated, heterogeneous compute architecture में जोड़ना है।
इस व्यवस्था में अलग-अलग हार्डवेयर अलग-अलग काम संभालेंगे:
इस रणनीति से AMD ग्राहकों को दो स्तरों वाला विकल्प दे सकता है: विविध और बदलते workloads के लिए लचीले GPU, तथा स्थिर और बड़े ट्रैफिक वाले मॉडलों के लिए बेहद तेज़ और ऊर्जा-कुशल विशेष चिप्स।
AMD और Taalas ने अधिग्रहण की वित्तीय शर्तों का खुलासा नहीं किया है। यह कदम AMD के हालिया बड़े अधिग्रहणों की कड़ी में आया है। कंपनी ने जुलाई 2024 में ZT Systems को $4.9 अरब में और अगस्त 2024 में Silo AI को $665 मिलियन में खरीदा था।
प्रतिस्पर्धा के स्तर पर यह सौदा Nvidia के खिलाफ AMD की रणनीति को और स्पष्ट करता है। रिपोर्टों के मुताबिक, Nvidia ने 2026 में Groq के साथ $20 अरब का लाइसेंसिंग सौदा किया है, जिससे उसे Groq की LPU inference architecture तक पहुंच मिलती है। AMD का दांव यह है कि Taalas की मॉडल-विशिष्ट हार्डवायरिंग, तय और बड़े पैमाने वाले inference workloads में प्रति वॉट बेहतर प्रदर्शन दे सकती है।
Taalas की स्थापना 2023 में Toronto में Ljubisa Bajic ने की थी। Bajic इससे पहले एक अन्य AI चिप स्टार्टअप Tenstorrent के CEO रह चुके हैं। कंपनी की शुरुआती टीम में पूर्व AMD इंजीनियर भी शामिल थे।
अधिग्रहण से पहले Taalas ने Eclipse Ventures, Makers Fund और Radical Ventures समेत निवेशकों से $219 मिलियन की वेंचर फंडिंग जुटाई थी।
कंपनी ने फरवरी 2026 में अपने HC1 चिप का प्रदर्शन किया था। इसी डेमो में Llama 3.1 8B को 16,960 टोकन प्रति सेकंड की गति से चलाने का आंकड़ा सामने आया, जिसने AI हार्डवेयर उद्योग का ध्यान खींचा।
Taalas का अधिग्रहण AMD के उस दांव को दर्शाता है जिसमें AI inference का भविष्य केवल अधिक शक्तिशाली general-purpose GPUs में नहीं, बल्कि खास मॉडलों के लिए बनाए गए अत्यधिक समर्पित चिप्स में भी देखा जा रहा है।
मॉडल को सीधे सिलिकॉन में शामिल करने से लचीलापन कम हो जाता है, लेकिन मेमोरी से वेट्स लाने की लगातार जरूरत हटने पर गति और ऊर्जा दक्षता में बड़ा फायदा मिल सकता है। Instinct GPUs और Taalas MSICs को साथ रखकर AMD एक ऐसा इंफ्रास्ट्रक्चर बनाना चाहता है जो एक ओर विविध AI workloads संभाले और दूसरी ओर सबसे लोकप्रिय मॉडलों के भारी inference ट्रैफिक को बेहद कम latency पर प्रोसेस करे। यही Nvidia के GPU-केंद्रित inference सिस्टम को चुनौती देने की AMD की मुख्य रणनीति है।