"הסקה" (inference) היא שלב הפעלת המודל לאחר האימון — למשל, הרגע שבו צ'אטבוט מייצר תשובה או מערכת ניתוח מעבדת תמונה. במעבדי GPU רגילים, כולל אלה של Nvidia, חלק ניכר מהזמן והאנרגיה מוקדש להעברת משקלי המודל מזיכרון ברוחב פס גבוה (HBM) אל ליבות החישוב. מגבלה זו מכונה לעיתים "קיר הזיכרון".
Taalas מנסה לעקוף את הקיר הזה באמצעות מעגלים משולבים ייעודיים למודל — Model-Specific Integrated Circuits, או MSIC. במהלך ייצור השבב מקבעים הן את ארכיטקטורת זרימת הנתונים של המודל והן את הערכים המספריים של המשקלים שלו בשכבות הלוגיקה והמתכת. כך אין צורך לטעון את המשקלים מהזיכרון בזמן הריצה.
שבב הניסוי HC1 של Taalas, שיוצר בתהליך של 6 ננומטר אצל TSMC, הפעיל בפברואר 2026 את מודל Llama 3.1 8B של Meta בקצב של 16,960 טוקנים בשנייה. החברה והדיווחים סביב ההדגמה הציגו את הנתון כעד פי 48 ממהירות ההסקה של GPU מקביל מבית Nvidia. מקורות אחרים ציינו יתרון של עד פי 73, בהתאם לדגם ולנקודת הייחוס שנבחרו להשוואה.
המשמעות המעשית היא פחות המתנה לכל תשובה ויעילות גבוהה יותר בעומסים שבהם משתמשים שוב ושוב באותו מודל — למשל שירות AI פופולרי שמשרת מספר גדול של משתמשים.
הביצועים מגיעים עם ויתור מהותי. מכיוון שהמשקלים נצרבים בסיליקון כבר במפעל, כל שבב של Taalas יכול להפעיל רק את המודל שעבורו יוצר. אי אפשר פשוט להתקין עליו מודל אחר, כפי שניתן לעשות ב-GPU גמיש.
Taalas פיתחה עם זאת שרשרת כלים שמקצרת את זמן ההתאמה למודל חדש. החברה מסיימת רק את שתי שכבות המתכת העליונות מתוך מערך בן כ-100 שכבות, בעוד שתכנון פרוסת הבסיס נשאר קבוע. לפי הדיווחים, כך ניתן להשלים תכנון וייצור ניסיוני של שבב למודל חדש בתוך כחודשיים — פרק זמן קצר יחסית לפיתוח ASIC מסורתי.
AMD מתכננת לשלב את שבבי ה-MSIC של Taalas בארכיטקטורת מחשוב הטרוגנית ומופרדת, לצד מעבדי ה-Instinct שלה ומערכות Helios בקנה מידה של ארון שרתים (rack-scale).
בתרחיש הזה, מעבדי Instinct הכלליים יטפלו באימון, במודלים משתנים ובהסקה שדורשת גמישות. שבבי Taalas יוקצו למודלים הפופולריים ביותר, שבהם יש עומס גבוה והדרישה היא לתפוקה גדולה ולזמן תגובה נמוך. פלטפורמת Helios אמורה לחבר את הרכיבים ברשת מחשוב מאוחדת בקנה מידה של ארון.
הגישה מאפשרת ל-AMD להציע כמה שכבות של תשתית: GPUs גמישים למגוון רחב של משימות, לצד שבבים ייעודיים וחסכוניים במיוחד עבור מודלים קבועים שמופעלים בהיקפים גדולים.
החברות לא פרסמו את תנאי העסקה או את שוויה. הרכישה מצטרפת לשורת עסקאות משמעותיות שביצעה AMD בשנים האחרונות, בהן רכישת ZT Systems תמורת 4.9 מיליארד דולר ביולי 2024 ורכישת Silo AI תמורת 665 מיליון דולר באוגוסט 2024.
מבחינה תחרותית, העסקה ממקמת את AMD מול מהלך שעליו דווח אצל Nvidia — עסקת רישוי בהיקף של 20 מיליארד דולר עם Groq, שנחשפה מוקדם יותר ב-2026 ומעניקה ל-Nvidia גישה לארכיטקטורת מעבדי ה-LPU של Groq. ההימור של AMD הוא ששבבים שמותאמים למודל ספציפי יציעו ביצועים טובים יותר לכל ואט בעומסי הסקה קבועים ורבי-נפח.
Taalas נוסדה ב-2023 בטורונטו בידי ליובישה באיץ' (Ljubisa Bajic), שכיהן בעבר כמנכ"ל Tenstorrent, ובידי צוות שכלל גם מהנדסים לשעבר של AMD.
לפני הרכישה גייסה החברה 219 מיליון דולר ממשקיעים, בהם Eclipse Ventures, Makers Fund ו-Radical Ventures. בפברואר 2026 הציגה את שבב הניסוי HC1 ואת ההדגמה עם Llama 3.1 8B — בקצב של 16,960 טוקנים בשנייה — נתון שמשך את תשומת לבה של AMD.
רכישת Taalas משקפת הימור של AMD על כך שהשלב הבא במרוץ ה-AI לא יישען רק על GPUs כלליים ומהירים יותר. במקום זאת, החברה בוחנת שילוב בין גמישות לבין התמחות קיצונית: מעבדי Instinct למודלים ולמשימות שמשתנים כל הזמן, ושבבי MSIC למודלים המבוקשים ביותר.
היתרון של Taalas ברור — ביטול כמעט מוחלט של העברת המשקלים מהזיכרון עשוי לשפר מאוד את המהירות ואת היעילות. אך גם המגבלה ברורה: כאשר המודל משתנה, נדרש למעשה שבב חדש. AMD מנסה להפוך את הפשרה הזו למעשית באמצעות מערכת משולבת שבה כל סוג מעבד מטפל במשימה המתאימה לו — מהלך שמאתגר את התלות של שוק ההסקה בתשתיות GPU בלבד.