Nvidia та d Matrix планують гібридну систему інференсу: GPU виконуватимуть важку фазу prefill, а XPU Raptor — поетапну генерацію токенів у фазі decode. NVLink Fusion, референсна архітектура MGX і мережеві компоненти Nvidia мають спростити впровадження спеціалізованого прискорювача в масштабі стійки, а не замінити GP...
ОпублікувавВідредаговано за допомогою GPT-5.6 TerraЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Для генеративних ШІ-сервісів важлива не лише загальна продуктивність, а й те, як швидко система починає відповідати та видає наступні слова. Саме на це спрямована вереснева співпраця Nvidia і d-Matrix: майбутні прискорювачі інференсу Raptor від d-Matrix мають підключатися безпосередньо до інфраструктури Nvidia, щоб різні етапи одного запиту до мовної моделі виконувалися на найбільш придатному для них обладнанні. 1
3
4
Головна ідея — не замінити GPU Nvidia. Йдеться про гетерогенну систему, де GPU обробляють ресурсоємну фазу prefill, а прискорювачі d-Matrix беруть на себе чутливу до затримки фазу decode — послідовну генерацію токенів, з яких складається відповідь моделі. 4
5
Запит до великої мовної моделі складається з етапів із різними вимогами. На етапі prefill модель обробляє промпт і весь наданий контекст. Під час decode вона багаторазово обчислює наступний токен — умовно, наступний фрагмент слова чи розділовий знак у відповіді. d-Matrix позиціонує свою архітектуру, зокрема нинішній продукт Corsair, для decode-обчислень поруч із GPU, які краще підходять для обчислювально важких завдань. 26
Такий поділ особливо актуальний для інтерактивних продуктів, де критичний час до появи наступного токена: чатботів, помічників для програмування та голосових інтерфейсів. Платформу Raptor d-Matrix націлює на преміальні сервіси з наднизькою затримкою генерації токенів. 4
8
Втім, сама спеціалізація не гарантує виграшу: процесори мають дуже швидко обмінюватися даними, інакше затримка на передаванні інформації нівелює користь. Саме цю системну проблему покликана вирішити інтеграція з інфраструктурою Nvidia.
За планом, Raptor використовуватиме NVLink Fusion для підключення до домену масштабування Nvidia NVLink, а Spectrum-X забезпечуватиме мережеве масштабування між системами. Nvidia заявляє, що це дає d-Matrix шлях для інтеграції власного кремнію до ширшої платформи ШІ-інфраструктури компанії. 3
Стійка d-Matrix базуватиметься на референсній архітектурі Nvidia MGX. У ній очікуються CPU Nvidia Vera, комутатори NVLink, DPU BlueField-4, мережеві адаптери ConnectX-9 SuperNIC та Ethernet-мережа Spectrum-X. 4
8
Для d-Matrix важливе не лише саме з’єднання між чипами. Замість самостійно перевіряти сумісність серверів, мереж, живлення, охолодження та ланцюга постачання навколо нового процесора, компанія отримує орієнтир у вигляді вже сформованої стійкової екосистеми MGX. Nvidia прямо називає це прискореним і менш ризикованим шляхом від кастомного чипа до масштабного розгортання. 3
Практично це означає, що Raptor задуманий не як окремий пристрій для інференсу, а як компонент AI-фабрики, сумісної з підходом Nvidia.
d-Matrix описала амбітну цільову конфігурацію Raptor: до 144 XPU в одній стійці, 2,3 ТБ 3D-стекованої DRAM та сукупна пропускна здатність пам’яті 7,2 ПБ/с. За заявою компанії, система має підтримувати моделі понад 4 трлн параметрів за 4-бітної точності. Це заплановані характеристики, а не незалежно перевірені показники серійного продукту. 4
Такий дизайн відображає підхід d-Matrix: швидкість decode у LLM значною мірою залежить від переміщення даних і доступної пропускної здатності пам’яті. Запропоноване 3D-пакування Raptor поєднує чип пам’яті DRAM і обчислювальний чип SRAM, продовжуючи орієнтовану на пам’ять архітектуру компанії. 4
d-Matrix очікує tape-out Raptor до кінця 2026 року, а початкову доступність у стійці MGX — у IV кварталі 2027 року. До цього ще потрібно пройти виробництво, пакування, перевірку системи й розгортання на рівні стійок. Лише після цього клієнти зможуть оцінити фактичну продуктивність у реальних навантаженнях. 4
8
Стратегічно показово, що Nvidia дозволяє спеціалізованому зовнішньому XPU підключатися до своєї стійкової архітектури та мережевої тканини, а не вимагає виконувати всі етапи інференсу лише на власних GPU.
Nvidia характеризує свою AI-платформу як «вертикально інтегровану й горизонтально відкриту»: компанія зберігає цінність своєї масштабованої мережі, стійкових дизайнів та екосистеми, водночас даючи іншим процесорам можливість працювати в ній. 3
Це може розширити набір задач, для яких підходить платформа. Замовникам, яким потрібен окремий прискорювач для decode, простіше залишатися в Nvidia-сумісній інфраструктурі, якщо він працює з NVLink Fusion, MGX і Spectrum-X. Тож це радше контрольована взаємодоповнюваність, а не відмова від GPU: GPU Nvidia залишаються ключовими для навчання моделей, універсального інференсу та важкого етапу prefill, тоді як спеціалізований пристрій пропонується для decode. 1
4
5
Raptor стане наступником інференсного прискорювача Corsair. d-Matrix заявляє, що Corsair створений саме для decode у розділеному інференсі та працює разом із GPU, а не замість них. 26
Компанія публікувала заяви про продуктивність, вартість і енергоефективність гібридних систем із Corsair. Утім, їх варто сприймати саме як твердження компанії, доки немає незалежно відтворюваних деталей бенчмарків. Надані матеріали не доводять універсального приросту для всіх моделей, розмірів пакетів чи конфігурацій розгортання. 25
28
d-Matrix залучила 275 млн доларів у раунді Series C за повідомленої оцінки 2 млрд доларів, довівши заявлений сукупний обсяг фінансування до 450 млн доларів. Серед учасників раунду був M12 — венчурний фонд Microsoft. 21
30 Reuters також повідомляв, що Microsoft інвестувала в d-Matrix у раунді 2023 року, а перший ШІ-чип компанія відвантажила в листопаді 2024 року.
1
Ці кроки вказують на перехід d-Matrix від пропозиції одного інференсного продукту до масштабнішої стійкової дорожньої карти. Інтеграція з Nvidia може додати їй переконливості для клієнтів, які вже купують або експлуатують інфраструктуру Nvidia.
Фінансові умови домовленості Nvidia і d-Matrix не оприлюднювалися. 1 Тому з публічних повідомлень неможливо встановити, чи передбачає вона ліцензійні платежі, спільні інженерні зобов’язання, закупівлі певних обсягів, розподіл виручки або інвестиції Nvidia.
Загальний висновок водночас зрозумілий: обидві компанії готуються до ринку, на якому один тип процесора не обов’язково виконує всі кроки запиту до LLM. d-Matrix отримує шлях до AI-фабрик, сумісних із Nvidia, а Nvidia — спеціалізований варіант для decode, інтегрований із її мережами та стійковою платформою. Чи перетвориться це на меншу затримку та кращу економіку в масштабі, залежатиме від готового обладнання Raptor, програмної оркестрації й клієнтських бенчмарків після запланованої доступності у 2027 році. 3
4
8
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nvidia та d Matrix планують гібридну систему інференсу: GPU виконуватимуть важку фазу prefill, а XPU Raptor — поетапну генерацію токенів у фазі decode.
Nvidia та d Matrix планують гібридну систему інференсу: GPU виконуватимуть важку фазу prefill, а XPU Raptor — поетапну генерацію токенів у фазі decode. NVLink Fusion, референсна архітектура MGX і мережеві компоненти Nvidia мають спростити впровадження спеціалізованого прискорювача в масштабі стійки, а не замінити GPU Nvidia.
Співпраця показує, що Nvidia відкриває свою AI інфраструктуру для спеціалізованих сторонніх чипів, водночас зберігаючи центральну роль NVLink, мереж і стійкових систем.