Представленная 18 августа 2026 года система Cerebras CS 4 — это стойка с тремя процессорами WSE 3 Turbo; компания заявляет до 30 кратного преимущества над GPU по числу токенов в секунду на одного пользователя, однако... Каждый WSE 3 Turbo сохраняет 900 000 ядер и 44 ГБ встроенной SRAM, а заявленные показатели вычисл...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How does Cerebras’s newly unveiled CS-4 rack-scale AI accelerator challenge Nvidia in AI inference, and what are its WSE-3 Turbo processor s. Article summary: Cerebras positions CS-4 as a specialized alternative to Nvidia GPU clusters for low-latency AI inference: a rack containing three wafer-scale WSE-3 Turbo processors, intended to accelerate chatbot and LLM responses. [2][. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Cerebras бросает вызов Nvidia в одном из самых важных сегментов ИИ-инфраструктуры — инференсе, то есть запуске уже обученной модели для генерации ответа. Новая CS-4 представляет собой стоечную систему на базе трёх процессоров WSE-3 Turbo. Cerebras утверждает, что по скорости генерации токенов для отдельного пользователя она может опережать GPU-системы до 30 раз.
Заявление звучит особенно привлекательно для чат-ботов и других приложений, где пользователь ждёт ответ в реальном времени. Но это не означает, что CS-4 в целом способна заменить Nvidia. Доступные материалы подтверждают основные характеристики и позиционирование системы, тогда как многие подробности архитектуры, планы масштабирования и дорожная карта пока не имеют достаточного независимого подтверждения.
CS-4 — не обычный сервер с большим количеством отдельных ускорительных карт, а стоечная inference-платформа. В её основе лежат три wafer-scale-процессора WSE-3 Turbo — огромных чипа, размещённых на кремниевой пластине практически целиком. Система рассчитана прежде всего на задачи, которым важны высокая и предсказуемая скорость генерации токенов.
Архитектура развивает идеи WSE-3, который, согласно опубликованным данным, содержит 4 трлн транзисторов, 900 000 оптимизированных для ИИ вычислительных ядер и 44 ГБ встроенной SRAM. Для предыдущего WSE-3 указывается пиковая производительность 125 петафлопса и пропускная способность памяти около 21 ПБ/с.
WSE-3 Turbo описывается как разогнанная версия того же базового дизайна. По имеющимся данным, он сохраняет 900 000 ядер, 44 ГБ SRAM и техпроцесс 5 нм, но работает на более высокой частоте и обеспечивает большую производительность.
В материалах Cerebras и публикациях о запуске приводятся следующие показатели:
Сравнение The Register указывает, что WSE-3 Turbo увеличивает заявленные показатели разреженных вычислений FP16 с 125 до 250 петафлопсов, пропускную способность памяти — с 21,6 до 43,2 ПБ/с, а I/O — с 1,2 до 2,4 Тбит/с. Для плотных вычислений FP16 в этой таблице приводится показатель 25 петафлопсов.
Однако это теоретические или заявленные производителем характеристики, а не универсальный показатель скорости любого приложения. Пиковые FLOPS стойки не превращаются автоматически в определённое число токенов в секунду для каждой модели и конфигурации сервинга.
В типичной GPU-системе модель распределяется между множеством отдельных процессоров. Такой подход хорошо масштабируется, но требует постоянно передавать данные между чипами и координировать вычисления через уровни памяти и сетевые соединения.
В стратегии Cerebras огромное количество вычислительных ядер и большой массив SRAM размещены на одном wafer-scale-процессоре. Компания подчёркивает, что WSE-3 использует SRAM непосредственно на чипе, а не полагается на внешнюю HBM-память, характерную для GPU. Предполагаемый выигрыш — снижение накладных расходов на обмен данными при декодировании, когда ответ формируется токен за токеном и задержка каждого шага влияет на ощущения пользователя.
Именно поэтому CS-4 выглядит наиболее убедительно как решение для скорости ответа на одного пользователя. Это более узкий, но практически важный вызов Nvidia, а не доказательство превосходства wafer-scale-архитектуры во всех ИИ-задачах. На сравнение также влияют обучение, пакетная обработка запросов, размер модели, объём памяти и совместимость программного обеспечения.
Cerebras продвигает CS-4 как систему, обеспечивающую инференс до 30 раз быстрее GPU-решений. В публикациях о запуске уточняется, что речь идёт о показателе токенов в секунду на одного пользователя, а не о гарантированном 30-кратном ускорении любой нагрузки.
Это принципиальная оговорка. Для честного сравнения ускорителей необходимо как минимум указать:
В предоставленных материалах нет полного набора параметров для воспроизводимого и независимо проверенного теста. Поэтому показатель 30x следует воспринимать как заявление Cerebras для определённых условий сервинга, а не как гарантированное преимущество над любой системой Nvidia.
Пиковые показатели ИИ-вычислений особенно легко неправильно интерпретировать, если они основаны на разреженной арифметике. Один из анализов отмечает, что показатель WSE-3 в 125 петафлопсов FP16 является разреженным и рассчитан при предположении о неструктурированной разреженности 8:1. Для плотных вычислений оценка составляет около 15,625 петафлопса.
Та же оговорка относится к заявленным 250 петафлопсам разреженных вычислений WSE-3 Turbo и 25 петафлопсам плотных FP16-вычислений. Разреженная пиковая производительность полезна только тогда, когда модель и программный стек действительно могут эффективно использовать соответствующий шаблон разреженности. Она не описывает автоматически скорость работы плотной большой языковой модели.
Для практического инференса важнее измерять сквозную задержку, устойчивую скорость генерации токенов, пропускную способность при заданной конкуренции, энергопотребление и стоимость одного токена. На эти результаты также влияют размер KV-кэша, степень распараллеливания модели, батчинг, соотношение этапов prefill и decode, квантование и зрелость среды исполнения.
CS-4 называют первой системой на базе архитектуры Nexus. Reuters сообщало, что стойка должна стать доступна в третьем квартале 2026 года, а в материалах о запуске говорится о начале первых поставок в текущем квартале.
При этом доступные источники не дают оснований считать подтверждёнными все детали, обсуждавшиеся вокруг продукта. В частности, независимо не подтверждены модульная конструкция «рюкзак» (backpack), switchless-соединение в виде двумерного тора, точные показатели охлаждения и энергопотребления стойки, а также обязательства по совокупной вычислительной мощности.
У Cerebras уже есть документированное сотрудничество с AWS в области разделённого инференса. В этой схеме системы AWS Trainium обрабатывают этап prefill — подготовку входного контекста, — а Cerebras CS-3 отвечает за decode, то есть за пошаговую генерацию токенов. Компоненты соединяются с помощью сети Amazon Elastic Fabric Adapter и предоставляются через Amazon Bedrock.
Этот пример важен: он показывает, что архитектура Cerebras может дополнять другие ускорители, а не обязательно вытеснять их. Поскольку prefill и decode предъявляют разные требования к оборудованию, гибридная система может распределять этапы между наиболее подходящими процессорами.
В предоставленных материалах также описана конфигурация AMD и Cerebras, в которой GPU AMD выполняют prefill, а процессоры Cerebras — декодирование. Руководители Cerebras заявили, что такая комбинация способна увеличить пропускную способность в пять раз; ожидаемый срок развёртывания — четвёртый квартал 2026 года. Это прогнозы и заявления компании, а не независимо подтверждённые результаты промышленной эксплуатации.
Источники не доказывают, что AWS или AMD уже взяли на себя обязательства по развёртыванию CS-4 в конкретном масштабе. Они подтверждают наличие партнёрств и планы гибридного инференса, но не гарантированный прирост производительности для любого заказчика.
Пока нет. CS-4 представляет собой серьёзный архитектурный вызов в более узком, но коммерчески ценном сегменте — низколатентном декодировании больших языковых моделей для интерактивных пользователей. Wafer-scale-процессор, встроенная SRAM и высокая внутренняя пропускная способность призваны уменьшить издержки обмена данными, возникающие при распределении инференса между множеством отдельных GPU.
Но положение Nvidia определяется не только пиковыми цифрами ускорителей. Не менее важны программная экосистема, поддержка моделей, доступность оборудования, сетевые возможности, совокупная стоимость владения и способность обслуживать широкий спектр моделей и нагрузок. Заявление о 30-кратном преимуществе также нуждается в сопоставимых бенчмарках, прежде чем его можно будет трактовать как общий прогноз вытеснения GPU.
Наиболее обоснованный вывод таков: CS-4 расширяет выбор технологий для ИИ-инференса. Система может оказаться особенно интересной там, где приоритетом является скорость выдачи токенов одному пользователю. Но будет ли она быстрее или дешевле конкретной конфигурации Nvidia, зависит от модели, режима нагрузки и методики тестирования.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Представленная 18 августа 2026 года система Cerebras CS 4 — это стойка с тремя процессорами WSE 3 Turbo; компания заявляет до 30 кратного преимущества над GPU по числу токенов в секунду на одного пользователя, однако...
Представленная 18 августа 2026 года система Cerebras CS 4 — это стойка с тремя процессорами WSE 3 Turbo; компания заявляет до 30 кратного преимущества над GPU по числу токенов в секунду на одного пользователя, однако... Каждый WSE 3 Turbo сохраняет 900 000 ядер и 44 ГБ встроенной SRAM, а заявленные показатели вычислений, пропускной способности памяти и I/O примерно вдвое выше, чем у WSE 3.
Главное преимущество архитектуры — потенциально меньшие затраты на обмен данными при пошаговой генерации ответа.