NVIDIA и d Matrix планируют гибридную схему инференса: GPU берут на себя вычислительно тяжёлый этап prefill, а XPU Raptor — последовательную генерацию токенов на этапе decode. NVLink Fusion, эталонная стоечная архитектура MGX и сетевые компоненты NVIDIA должны упростить интеграцию специализированных ускорителей в ин...
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How is AI-chip startup d-Matrix’s September 2026 partnership with Nvidia—integrating Nvidia’s NVLink Fusion into its next-generation Raptor. Article summary: The partnership makes d-Matrix’s specialized inference silicon a first-class component of Nvidia-style AI factories rather than a separate appliance. The intended architecture is heterogeneous: Nvidia GPUs handle compute. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers,
Генеративные ИИ-сервисы всё чаще оценивают не только по качеству ответа, но и по тому, как быстро модель начинает его выдавать и поддерживает темп генерации. На эту задачу нацелено объявленное в сентябре 2026 года сотрудничество NVIDIA и d-Matrix: будущие инференс-ускорители Raptor XPU планируют напрямую подключать к инфраструктуре NVIDIA, чтобы распределять этапы обработки запроса между наиболее подходящими процессорами. 1
3
4
Главное здесь — дополнение, а не замена. Raptor не позиционируется как замена GPU NVIDIA. Предполагается гетерогенная система, в которой GPU выполняют ресурсоёмкий этап prefill — обработку запроса и контекста, — а ускорители d-Matrix берут на себя чувствительный к задержкам этап decode, когда модель выдаёт токены один за другим. 4
5
У этих этапов разные требования к оборудованию. На prefill приходится интенсивная вычислительная работа с исходным промптом и контекстом. Decode — это многократно повторяющаяся генерация следующего токена. d-Matrix позиционирует свою архитектуру, включая уже выпускаемый ускоритель Corsair, именно для decode; GPU компания называет особенно подходящими для вычислительно тяжёлых задач. 26
Такое разделение может быть полезно в интерактивных продуктах, где важна задержка до следующего токена: ассистентах для программирования, чатах и голосовых интерфейсах. Целевая аудитория Raptor — сервисы с премиальной, сверхнизколатентной выдачей токенов. 4
8
Однако специализация создаёт и инженерную проблему: между процессорами нужно быстро передавать данные, иначе выигрыш от разделения работы исчезнет из-за коммуникационных задержек. Именно на это рассчитан выбранный набор межсоединений и сетевых компонентов.
Raptor планируют подключать к домену масштабирования NVIDIA NVLink через NVLink Fusion, а сеть Spectrum-X будет использоваться для масштабирования между системами. По оценке NVIDIA, это даёт d-Matrix путь к подключению специализированного кремния к более широкой платформе ИИ-инфраструктуры компании. 3
Проектируемая стойка d-Matrix будет базироваться на эталонной архитектуре NVIDIA MGX. В неё должны войти CPU NVIDIA Vera, коммутаторы NVLink, DPU BlueField-4, сетевые адаптеры ConnectX-9 SuperNIC и Ethernet-сеть Spectrum-X. 4
8
Для d-Matrix ценен не только сам интерконнект. Вместо самостоятельной проверки совместимости серверов, сети, питания, охлаждения и цепочек поставок вокруг нового чипа компания получает ориентир в виде уже валидированной стоечной экосистемы. NVIDIA прямо описывает MGX и свою платформу как способ быстрее и с меньшим риском пройти путь от специализированного кремния до крупномасштабного развёртывания. 3
Практически это означает попытку вывести Raptor на рынок не как отдельный инференс-прибор, а как компонент ИИ-фабрики в стиле NVIDIA.
d-Matrix раскрыла амбициозные целевые параметры стоечной конфигурации Raptor: до 144 XPU на стойку, 2,3 ТБ 3D-стековой DRAM и 7,2 ПБ/с совокупной пропускной способности памяти. Компания заявляет, что архитектура должна поддерживать модели размером более 4 трлн параметров при 4-битной точности. Это плановые спецификации, а не независимо подтверждённые показатели готового продукта. 4
Архитектура отражает подход d-Matrix: при decode производительность во многом определяется перемещением данных и доступной пропускной способностью памяти. В предлагаемом 3D-корпусе Raptor сочетаются кристалл памяти DRAM и вычислительный кристалл SRAM. 4
d-Matrix ожидает завершить tape-out Raptor к концу 2026 года, а первоначальную доступность системы в стойке MGX — в IV квартале 2027 года. До этого остаётся значительный объём работ: выпуск чипа, производство, корпусирование, валидация системы и развёртывание стойки должны пройти успешно, прежде чем заказчики смогут оценить реальные показатели. 4
8
Стратегически заметно, что NVIDIA разрешает специализированному внешнему XPU подключаться к своей стоечной архитектуре и сетевой фабрике, а не требует выполнять все этапы инференса исключительно на собственных GPU.
NVIDIA описывает свою ИИ-платформу как «вертикально интегрированную и горизонтально открытую»: компания сохраняет ценность масштабируемого интерконнекта, сетей, стоечных конструкций и экосистемы, но позволяет участвовать и другим процессорам. 3
Это расширяет круг задач, которые может охватывать платформа. Заказчику, которому нужен специализированный ускоритель для decode, проще остаться в NVIDIA-совместимой инфраструктуре, если такой ускоритель работает с NVLink Fusion, MGX и Spectrum-X. Поэтому эту стратегию точнее считать контролируемой взаимодополняемостью, а не отходом от GPU: графические процессоры NVIDIA сохраняют центральную роль в обучении, универсальном инференсе и тяжёлом этапе prefill, тогда как специализированное устройство нацелено на decode. 1
4
5
Raptor станет развитием инференс-ускорителя d-Matrix Corsair. Компания заявляет, что Corsair создан специально для decode в раздельном инференсе и работает вместе с GPU, а не вместо них. 26
d-Matrix публиковала заявления о производительности, стоимости и энергоэффективности гибридных систем на базе Corsair. Но без независимых и воспроизводимых тестов эти цифры следует считать заявлениями производителя. Представленные материалы не доказывают универсального преимущества для всех моделей, размеров пакетов запросов и конфигураций развёртывания. 25
28
Компания привлекла $275 млн в раунде Series C при заявленной оценке $2 млрд, а общий объём привлечённых средств, по её данным, достиг $450 млн. В раунде участвовал M12 — венчурный фонд Microsoft — наряду с другими инвесторами. 21
30 Reuters также сообщал, что Microsoft инвестировала в d-Matrix в раунде 2023 года, а первый ИИ-чип компании был поставлен в ноябре 2024 года.
1
Эти этапы указывают, что d-Matrix пытается перейти от предложения одного инференс-продукта к более широкому плану стоечных систем. Интеграция с NVIDIA может сделать этот переход убедительнее для заказчиков, уже эксплуатирующих инфраструктуру NVIDIA.
Финансовые условия соглашения NVIDIA и d-Matrix не раскрывались. 1 Поэтому из публичного объявления нельзя установить, предусматривает ли договор лицензионные платежи, совместную разработку, закупки определённого объёма, разделение выручки или инвестиции NVIDIA.
Общий вывод, однако, понятен: обе компании готовятся к рынку инференса, на котором не один тип процессора обязан выполнять все части запроса к большой языковой модели. d-Matrix получает путь в совместимые с NVIDIA ИИ-фабрики, а NVIDIA — специализированный вариант для decode, интегрируемый с её сетевой и стоечной платформой. Приведёт ли этот подход к меньшим задержкам и лучшей экономике в масштабе, покажут готовое оборудование Raptor, программная оркестрация и тесты заказчиков после ожидаемого появления систем в 2027 году. 3
4
8
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
NVIDIA и d Matrix планируют гибридную схему инференса: GPU берут на себя вычислительно тяжёлый этап prefill, а XPU Raptor — последовательную генерацию токенов на этапе decode.
NVIDIA и d Matrix планируют гибридную схему инференса: GPU берут на себя вычислительно тяжёлый этап prefill, а XPU Raptor — последовательную генерацию токенов на этапе decode. NVLink Fusion, эталонная стоечная архитектура MGX и сетевые компоненты NVIDIA должны упростить интеграцию специализированных ускорителей в инфраструктуру дата центра, а не заменить GPU NVIDIA.
Сотрудничество показывает, что NVIDIA открывает свою платформу для специализированных сторонних чипов, сохраняя ключевую роль за NVLink, сетями и стоечными системами.