WSE-3 Turbo описується як розігнана версія тієї самої базової конструкції WSE-3. За наявними даними, процесор зберігає 900 000 ядер, 44 ГБ SRAM і 5-нанометровий техпроцес, але працює на вищих частотах.
Cerebras та джерела, що описують презентацію, наводять такі показники CS-4:
The Register повідомляє, що WSE-3 Turbo збільшує розріджену продуктивність FP16 на одну пластину зі 125 до 250 петафлопсів, пропускну здатність пам’яті — з 21,6 до 43,2 ПБ/с, а I/O — з 1,2 до 2,4 Тбіт/с. Для Turbo також наводиться показник 25 петафлопсів щільної продуктивності FP16.
Ці цифри описують теоретичні або заявлені виробником можливості, а не універсальний показник швидкодії застосунків. Пікові FLOPS стійки не перетворюються автоматично на однакову кількість токенів за секунду для кожної моделі та конфігурації обслуговування.
У системах на базі GPU робота моделі зазвичай розподіляється між великою кількістю окремих процесорів. Такий підхід добре масштабується, але потребує передавання даних між чипами та координації обчислень через рівні пам’яті й мережеву інфраструктуру.
Wafer-scale підхід Cerebras розміщує величезну кількість обчислювальних ядер і великий масив SRAM на одному процесорі. Компанія заявляє, що WSE-3 працює із SRAM безпосередньо на чипі, а не покладається на зовнішню HBM-пам’ять, типову для GPU. Очікуваний ефект — менше накладних витрат на обмін даними під час поетапного декодування, коли кожен новий токен залежить від швидкості доступу до пам’яті та синхронізації.
Саме тому CS-4 найпереконливіше виглядає у сценаріях, де важлива швидкість відповіді для конкретного користувача — наприклад, в інтерактивних чатботах. Це більш вузький, але комерційно важливий виклик для NVIDIA, а не твердження, що wafer-scale системи кращі для будь-якого AI-навантаження. Навчання моделей, пакетний інференс із високою пропускною здатністю, обсяг пам’яті, підтримка моделей і сумісність програмного забезпечення можуть повністю змінити результат порівняння.
Cerebras просуває CS-4 як систему, що забезпечує інференс до 30 разів швидший за GPU-рішення. Висвітлення презентації уточнює: йдеться саме про кількість токенів за секунду для одного користувача, а не про загальне прискорення у 30 разів для всіх можливих навантажень.
Це важливе уточнення. Щоб порівняння прискорювачів було переконливим, потрібно щонайменше вказати:
Надані матеріали не містять усіх цих даних у форматі, який можна відтворити й незалежно перевірити. Тому показник 30× варто сприймати як заяву Cerebras, прив’язану до певних умов обслуговування, а не як гарантовану перевагу над будь-яким розгортанням NVIDIA.
Пікові показники AI-обчислень можуть особливо вводити в оману, якщо йдеться про розріджену арифметику. Один з аналізів зазначає, що показник WSE-3 у 125 петафлопсів FP16 є розрідженим і базується на припущенні про розрідженість без заданої структури у співвідношенні 8:1. За його оцінкою, щільна продуктивність FP16 становить близько 15,625 петафлопса.
Те саме потрібно враховувати під час інтерпретації заявлених 250 петафлопсів розрідженої продуктивності WSE-3 Turbo та 25 петафлопсів щільної продуктивності. Пікова розріджена продуктивність має практичну цінність, якщо модель і програмний стек можуть ефективно використовувати відповідний шаблон розрідженості. Вона не описує автоматично швидкодію щільної LLM.
Для практичного інференсу набагато важливіші наскрізна затримка, стабільна кількість токенів за секунду, пропускна здатність за визначеної кількості одночасних запитів, споживання енергії та вартість одного згенерованого токена. На ці показники також впливають розмір KV-кешу, паралелізм моделі, батчинг, співвідношення префілу й декодування, квантизація та зрілість середовища виконання.
CS-4 описується як перша система на базі архітектури Nexus. Reuters повідомляло, що стійка мала стати доступною у третьому кварталі 2026 року, тоді як матеріали презентації вказували на початок перших поставок у поточному кварталі.
Надані джерела не дають достатньо інформації, щоб перевірити всі архітектурні деталі, згадані в початковому обговоренні. Зокрема, незалежного підтвердження не мають модульна конструкція «рюкзак», безкомутаторне з’єднання у вигляді двовимірного тора, точні параметри охолодження та енергоспоживання стійки, а також узгоджений план сумарної обчислювальної потужності. Без сильнішої технічної документації ці твердження не слід подавати як остаточно встановлені характеристики CS-4.
Cerebras уже має задокументовану співпрацю з AWS у сфері розділеного інференсу. У такій архітектурі системи AWS Trainium виконують етап префілу, а системи Cerebras CS-3 — декодування; компоненти з’єднуються через мережу Amazon Elastic Fabric Adapter і надаються через Amazon Bedrock.
Це важливо, оскільки показує: архітектура Cerebras може доповнювати інші прискорювачі, а не лише конкурувати з ними напряму. Префіл і декодування мають різні характеристики навантаження, тому гібридна система може передавати кожен етап обладнанню, яке краще для нього підходить.
У наданих матеріалах також описана конфігурація AMD і Cerebras, у якій GPU AMD мають виконувати префіл, а процесори Cerebras — декодування. Керівники Cerebras заявили, що така схема може збільшити пропускну здатність у п’ять разів, а її розгортання очікується у четвертому кварталі 2026 року. Це прогнозні заяви компанії, а не незалежно перевірені результати роботи у виробничому середовищі.
Доказів того, що AWS або AMD зобов’язалися розгорнути CS-4 у конкретному масштабі, немає. Джерела підтверджують партнерства та заплановану роботу над гібридним інференсом, але не гарантують певного приросту пропускної здатності для кожного клієнта.
Поки що — ні. CS-4 є серйозним архітектурним викликом у вужчому, але цінному сегменті: низьколатентному декодуванні LLM для інтерактивних користувачів. Wafer-scale процесор, SRAM на самій пластині та висока внутрішня пропускна здатність мають зменшити витрати на обмін даними, які виникають, коли інференс розподіляється між багатьма окремими GPU.
Водночас позиції NVIDIA визначаються не лише піковими цифрами прискорювачів. Не менш важливі програмна екосистема, підтримка моделей, доступність обладнання, мережеві можливості, сукупна вартість володіння та здатність обслуговувати різні моделі й типи навантажень. Заява про перевагу у 30 разів також потребує зіставних тестів, перш ніж її можна буде трактувати як загальне витіснення GPU.
Найобережніший і водночас найточніший висновок такий: CS-4 розширює вибір інфраструктури для AI-інференсу. Система може бути особливо привабливою там, де пріоритетом є швидкість генерації токенів для одного користувача. Але те, чи буде вона швидшою або дешевшою за конкретне рішення NVIDIA, залежить від навантаження та методики тестування.