Cerebras 于 2026 年 8 月 18 日发布 CS 4。这是一套由三颗 WSE 3 Turbo 处理器组成的机架级推理系统,公司宣称其单用户每秒生成令牌数最高可达 GPU 系统的 30 倍,但这一数字并非经过独立、对等条件验证的通用结论。[5][10] 每颗 WSE 3 Turbo 保留 90 万个核心和 44 GB 片上 SRAM;Cerebras 及相关报道显示,其计算、内存带宽和 I/O 等关键指标较 WSE 3 提升约一倍。[3][4] CS 4 的核心优势在于把大模型解码工作尽可能留在晶圆级芯片上,从而减少多 GPU 系统中的数据传输和同步开销;实际效果仍取决于模型、并发量、精度、上下文长度、稀疏性和软件栈。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Cerebras’s newly unveiled CS-4 rack-scale AI accelerator challenge Nvidia in AI inference, and what are its WSE-3 Turbo processor s. Article summary: Cerebras positions CS-4 as a specialized alternative to Nvidia GPU clusters for low-latency AI inference: a rack containing three wafer-scale WSE-3 Turbo processors, intended to accelerate chatbot and LLM responses. [2][. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Cerebras 正在 AI 基础设施中一个极具商业价值的环节挑战英伟达:推理,也就是利用已经训练好的模型生成回答。公司推出的 CS-4 是一套机架级系统,内部搭载三颗 WSE-3 Turbo 处理器,并宣称在单用户场景下,生成令牌的速度最高可达到 GPU 系统的 30 倍。
这个数字让 CS-4 成为聊天机器人和大语言模型(LLM)低延迟服务领域值得关注的替代方案。但它并不等于 Cerebras 已经能够全面取代英伟达。现有证据足以支持 CS-4 的基本规格和产品定位,而一些更具体的架构、部署规模及未来路线图说法,仍缺乏独立验证。
CS-4 不是一台塞入大量独立加速卡的传统服务器,而是一套以晶圆级处理器为核心的机架级推理平台。它由三颗 WSE-3 Turbo 芯片组成,目标是服务那些更看重快速、稳定生成令牌的 AI 应用。
该系统建立在 WSE-3 基础上。资料显示,WSE-3 集成了约 4 万亿个晶体管、90 万个 AI 优化计算核心和 44 GB 片上 SRAM。 一项技术比较称,上一代 WSE-3 的峰值计算性能为 125 petaflops,内存带宽约为每秒 21 PB。
WSE-3 Turbo 被描述为 WSE-3 的超频版本。现有报道显示,它保留了 90 万个核心、44 GB SRAM 和 5 纳米制造工艺,同时通过提高运行性能来增加吞吐量。
Cerebras 及发布报道给出的核心指标包括:
《The Register》的对比数据显示,WSE-3 Turbo 将每片晶圆的稀疏 FP16 计算性能从 125 petaflops 提升至 250 petaflops,内存带宽从 21.6 PB/s 提升至 43.2 PB/s,I/O 带宽则从 1.2 Tb/s 提升至 2.4 Tb/s。该报道还列出了 Turbo 处理器 25 petaflops 的密集 FP16 计算性能。
需要注意的是,这些数字主要代表理论峰值或厂商报告的能力,并不能直接等同于所有应用中的实际表现。机架的峰值 FLOPS 并不会自动转换成每秒生成多少令牌;最终结果还取决于模型和推理服务配置。
基于 GPU 的系统通常会把模型计算分布到多颗独立处理器上。这种方式具有良好的扩展性,但也意味着数据需要在芯片之间传输,计算过程还要经过内存和网络层的协调。
Cerebras 的晶圆级设计则试图把大量计算核心和 SRAM 资源放在同一颗处理器上。Cerebras 表示,WSE-3 直接使用芯片上的 SRAM,而不是依赖 GPU 常见的片外高带宽内存(HBM)。 这一设计的目标,是降低逐令牌解码过程中的通信开销,因为每生成一个令牌,都可能受到内存访问和同步延迟的影响。
因此,CS-4 最有吸引力的场景是单个用户的响应速度,尤其是交互式应用。它对英伟达构成的挑战更像是一次针对特定场景的架构竞争,而不是证明晶圆级系统在所有 AI 任务中都更优。训练、批量推理、模型规模、内存需求和软件兼容性,都可能改变最终比较结果。
Cerebras 将 CS-4 宣传为比 GPU 系统快最高 30 倍的推理平台。 发布报道明确指出,这一比较针对的是每位用户每秒生成的令牌数,而不是所有工作负载都普遍提升 30 倍。
这个区别十分关键。要让加速器对比具有可复现性,至少需要说明:
现有资料没有提供一套完整、可复现且经过独立审计的对比测试。因此,“30 倍”更适合被理解为Cerebras 在特定服务条件下提出的厂商说法,而不是对所有英伟达部署都成立的保证。
当峰值 AI 算力采用稀疏计算口径时,数字尤其容易造成误解。一项分析指出,WSE-3 宣传的 125 petaflops FP16 是基于假设的 8:1 非结构化稀疏率得出的稀疏性能;按密集计算口径估算,性能约为 15.625 petaflops。
解读 WSE-3 Turbo 宣传的 250 petaflops 稀疏性能和 25 petaflops 密集性能时,也要采用同样的区分方式。 只有当模型和软件栈能够高效利用相应的稀疏模式时,稀疏峰值性能才具有实际意义。它并不能自动代表密集型大语言模型的吞吐量。
对实际推理而言,更值得关注的指标包括端到端延迟、持续每秒生成令牌数、特定并发量下的吞吐量、功耗以及每个生成令牌的成本。这些结果还会受到 KV 缓存大小、模型并行方式、批处理、预填充与解码的工作比例、量化方案和运行时成熟度影响。
CS-4 被描述为首款采用 Cerebras Nexus 平台架构的系统。 路透社报道称,该机架预计在 2026 年第三季度上市;发布报道则称首批产品将于当前季度开始出货。
不过,现有来源不足以核实原始讨论中涉及的所有架构细节。尤其是所谓模块化“背包式”设计、无交换机二维环面互连、确切的机架散热与功耗特性,以及已承诺的总体算力容量计划,目前都不能在缺少更强技术文档的情况下视为确定的 CS-4 规格。
Cerebras 已经公开了一项与 AWS 合作的解耦推理方案。在该架构中,AWS Trainium 系统负责预填充阶段,Cerebras CS-3 系统负责解码,两者通过 Amazon 的 Elastic Fabric Adapter(EFA)网络连接,并通过 Amazon Bedrock 提供服务。
这一合作说明,Cerebras 的架构可以与其他加速器形成互补,而不只是单纯替代 GPU。由于预填充和解码的性能特征不同,混合系统可以把两个阶段分别交给更适合的硬件处理。
现有报道还介绍了一种 AMD 与 Cerebras 的组合方案:由 AMD GPU 负责预填充,再由 Cerebras 处理器负责解码。Cerebras 高管表示,该方案可能将吞吐量提高五倍,预计在 2026 年第四季度部署。 但这些仍是公司的前瞻性说法,并非经过独立验证的生产环境结果。
目前的证据不能证明 AWS 或 AMD 已经承诺以某一确定规模部署 CS-4。可以确认的是双方存在合作及计划中的混合推理工作,但不能据此推导出每位客户都能获得确定的吞吐量提升。
至少目前还不能这样说。 CS-4 真正构成挑战的,是一个更窄但很有价值的市场:面向交互式用户的低延迟大模型解码。它通过晶圆级处理器、片上 SRAM 和高内部带宽,试图减少推理分散到多颗独立 GPU 后产生的通信成本。
但英伟达的竞争力并不只由加速器峰值参数决定。软件生态、模型支持、产品供应、网络能力、总体拥有成本,以及同时服务多种模型和工作负载的能力,同样重要。Cerebras 的“30 倍”说法也必须经过模型、硬件和服务条件完全匹配的基准测试,才能被用来概括 GPU 是否会被取代。
更稳妥的结论是:CS-4 为 AI 推理市场增加了一个有分量的竞争选项。当首要目标是提升单用户令牌生成速度时,它可能颇具吸引力;但在具体部署中究竟更快还是更便宜,仍取决于工作负载和测试方法。
Studio Global AI
此页面包含一个有来源支持的答案,您可以在 Studio Global 内继续。
Cerebras 于 2026 年 8 月 18 日发布 CS 4。这是一套由三颗 WSE 3 Turbo 处理器组成的机架级推理系统,公司宣称其单用户每秒生成令牌数最高可达 GPU 系统的 30 倍,但这一数字并非经过独立、对等条件验证的通用结论。[5][10]
Cerebras 于 2026 年 8 月 18 日发布 CS 4。这是一套由三颗 WSE 3 Turbo 处理器组成的机架级推理系统,公司宣称其单用户每秒生成令牌数最高可达 GPU 系统的 30 倍,但这一数字并非经过独立、对等条件验证的通用结论。[5][10] 每颗 WSE 3 Turbo 保留 90 万个核心和 44 GB 片上 SRAM;Cerebras 及相关报道显示,其计算、内存带宽和 I/O 等关键指标较 WSE 3 提升约一倍。[3][4]
CS 4 的核心优势在于把大模型解码工作尽可能留在晶圆级芯片上,从而减少多 GPU 系统中的数据传输和同步开销;实际效果仍取决于模型、并发量、精度、上下文长度、稀疏性和软件栈。