Cerebras 於 2026 年 8 月 18 日公布 CS 4:每個機架配備 3 枚 WSE 3 Turbo,並聲稱每位用戶生成 token 速度最高比 GPU 系統快 30 倍;但呢個數字未有獨立、完全對等嘅基準測試支持。[5][10] 每枚 WSE 3 Turbo 保留 900,000 個 AI 核心及 44GB 晶圓上 SRAM;據報告,計算、記憶體頻寬及 I/O 頻寬較上一代 WSE 3 大幅提升。[3][4] CS 4 最有吸引力嘅地方係低延遲 LLM 解碼,而唔係單靠峰值 FLOPS 證明全面勝過 Nvidia;實際表現仍取決於模型、批次大小、精度、上下文長度、稀疏度及軟件支援。
研究答案

Create a landscape editorial hero image for this Studio Global article: How does Cerebras’s newly unveiled CS-4 rack-scale AI accelerator challenge Nvidia in AI inference, and what are its WSE-3 Turbo processor s. Article summary: Cerebras positions CS-4 as a specialized alternative to Nvidia GPU clusters for low-latency AI inference: a rack containing three wafer-scale WSE-3 Turbo processors, intended to accelerate chatbot and LLM responses. [2][. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Cerebras 想喺 AI 基建最關鍵嘅一環——推理(inference)——挑戰 Nvidia。推理即係模型訓練完成之後,逐個 token 生成聊天機械人回覆嘅過程。公司最新推出嘅 CS-4 係一套機架級系統,以 3 枚 WSE-3 Turbo 晶圓級處理器為核心,聲稱每位用戶嘅 token 生成速度最高比 GPU 系統快 30 倍。
呢個宣稱對需要即時回覆嘅聊天機械人及大型語言模型(LLM)服務相當吸引。不過,佢唔代表 Cerebras 已經可以全面取代 Nvidia。現有資料足以確認 CS-4 嘅基本規格及市場定位,但部分架構細節、部署規模及未來產品路線,仍然欠缺獨立資料核實。
CS-4 唔係一部插滿獨立加速卡嘅傳統伺服器,而係一套將多枚晶圓級處理器整合喺同一機架嘅 AI 推理平台。系統配備 3 枚 WSE-3 Turbo,主要針對需要快速而穩定生成 token 嘅 AI 工作負載。
WSE-3 Turbo 建基於 WSE-3。後者據報有 4 萬億粒電晶體、900,000 個 AI 優化運算核心,以及 44GB 晶圓上 SRAM。 技術比較資料顯示,WSE-3 峰值運算量為 125 petaflops,記憶體頻寬約 21 petabytes 每秒。
現有報道形容 WSE-3 Turbo 係 WSE-3 嘅超頻版本:保留相同嘅 900,000 個核心、44GB SRAM 及台積電 5nm 製程,但提高運作效能。
Cerebras 及相關發布資料列出 CS-4 嘅主要數字包括:
《The Register》嘅比較指出,WSE-3 Turbo 每片晶圓嘅稀疏 FP16 運算量由 125 petaflops 升至 250 petaflops;記憶體頻寬由 21.6 PB/s 升至 43.2 PB/s;I/O 頻寬則由 1.2 Tb/s 升至 2.4 Tb/s。報道亦列出 Turbo 處理器有 25 petaflops 密集 FP16 運算量。
但要留意,呢啲係理論峰值或者廠商公布數字,唔係所有應用都適用嘅實際效能指標。一個機架有幾多 FLOPS,唔會直接等於任何模型或部署方式下嘅每秒 token 數。
GPU 系統通常會將模型運算分散到大量獨立處理器。呢種方法容易擴展,但處理器之間要傳送資料,亦要經過記憶體及網絡層協調運算。
Cerebras 嘅晶圓級設計,就係將大量運算核心及 SRAM 記憶體 fabric 放喺同一枚大型處理器上。Cerebras 表示,WSE-3 直接使用晶片上 SRAM,而唔係依賴 GPU 常見嘅晶片外 HBM。 理論上,呢種安排可以減少逐個 token 解碼時嘅資料傳輸、記憶體存取及同步開銷。
所以,CS-4 最有機會發揮優勢嘅場景係單一用戶嘅回覆速度,例如互動式聊天、程式碼助手及其他對延遲敏感嘅應用。呢個係針對 Nvidia 嘅一個較集中、較實際嘅挑戰,而唔係證明晶圓級系統喺所有 AI 工作負載都更好。
模型訓練、批量推理、模型大小、所需記憶體及軟件兼容性,都可能令比較結果完全唔同。
Cerebras 將 CS-4 宣傳為推理速度最高比 GPU 系統快 30 倍。 發布報道所講嘅比較,具體係每位用戶每秒生成幾多 token,而唔係所有工作負載整體快 30 倍。
呢個分別非常重要。要公平比較兩套 AI 加速器,至少要交代:
現有資料未有提供一套完整、可重現,而且經獨立審核嘅對照測試。因此,「30 倍」應該理解為Cerebras 喺特定服務條件下提出嘅廠商宣稱,唔可以當成對所有 Nvidia 部署都必然成立嘅優勢。
AI 加速器嘅峰值運算數字,如果採用稀疏運算,尤其容易令人誤會。分析指出,WSE-3 所標示嘅 125 petaflops FP16 係稀疏數字,建基於假設模型採用 8:1 非結構化稀疏度;按此估算,密集 FP16 吞吐量約為 15.625 petaflops。
同一道理亦適用於 WSE-3 Turbo 所報嘅 250 petaflops 稀疏運算量,以及 25 petaflops 密集運算量。 如果模型及軟件堆疊未能有效利用相應稀疏模式,稀疏峰值效能就唔能夠直接代表密集 LLM 嘅實際吞吐量。
對 AI 服務商嚟講,更有參考價值嘅數字通常係:端到端延遲、穩定每秒 token 數、指定並發量下嘅吞吐量、耗電量,以及每個生成 token 嘅成本。結果亦會受 KV cache 大小、模型並行、批處理、prefill 與 decode 比例、量化方式及運行時軟件成熟度影響。
CS-4 被形容為首套採用 Cerebras Nexus 平台架構嘅系統。 路透社報道指,呢套機架預計於 2026 年第三季推出;其他發布報道則指首批出貨會喺當季開始。
不過,現有來源未足以核實原先討論中所有架構描述。包括模組化「背包」設計、無交換器 2D torus 互連、機架確實嘅散熱及功耗數據,以及已承諾嘅總運算容量,都未有足夠獨立文件支持。因此,呢啲內容唔應該當成已確定嘅 CS-4 規格。
Cerebras 已有公開記錄嘅 AWS 合作,重點係將推理拆成兩個階段:由 AWS Trainium 系統處理 prefill,再由 Cerebras CS-3 系統處理解碼;兩者透過 Amazon Elastic Fabric Adapter(EFA)網絡連接,並經 Amazon Bedrock 提供服務。
呢種做法反映 Cerebras 可以同其他加速器互補,而唔一定要直接取代對方。因為 prefill 同 decode 嘅性能特性唔同,混合架構可以將兩個階段分配畀較適合嘅硬件。
現有報道亦提到一套 AMD 與 Cerebras 嘅配置:由 AMD GPU 負責 prefill,Cerebras 處理解碼。Cerebras 高層表示,呢種安排有機會令吞吐量提高 5 倍,預計於 2026 年第四季部署。 不過,呢啲仍然係公司向前展望嘅說法,唔係獨立核實嘅生產環境結果。
現有證據未能證明 AWS 或 AMD 已經承諾以某個指定規模部署 CS-4,亦未能保證每位客戶都會獲得相同吞吐量提升。可以確認嘅係雙方合作及混合推理計劃,而唔係一個對所有場景適用嘅 5 倍加速保證。
暫時未可以咁講。 CS-4 確實對 GPU 主導嘅 AI 推理模式構成一個有份量、但範圍較集中的挑戰,尤其係互動式用戶所重視嘅低延遲 LLM 解碼。晶圓級處理器、晶片上 SRAM 及極高內部頻寬,目的係減少將推理分散到多枚 GPU 時產生嘅通信成本。
但 Nvidia 嘅競爭力唔係只睇峰值運算數字。軟件生態、模型支援、供貨情況、網絡能力、總擁有成本,以及同時服務多款模型及多種工作負載嘅能力,同樣關鍵。Cerebras 嘅 30 倍宣稱亦需要經過模型、硬件、批次及成本條件完全對齊嘅測試,先可以用作廣泛評估 GPU 是否會被取代。
較穩妥嘅結論係:CS-4 為 AI 推理市場增加咗一個有特色嘅選項。當最重要嘅指標係單一用戶嘅 token 生成速度時,佢可能相當有吸引力;但喺某個具體部署入面究竟係咪更快、更平,仍然要視乎工作負載及測試方法。
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
Cerebras 於 2026 年 8 月 18 日公布 CS 4:每個機架配備 3 枚 WSE 3 Turbo,並聲稱每位用戶生成 token 速度最高比 GPU 系統快 30 倍;但呢個數字未有獨立、完全對等嘅基準測試支持。[5][10]
Cerebras 於 2026 年 8 月 18 日公布 CS 4:每個機架配備 3 枚 WSE 3 Turbo,並聲稱每位用戶生成 token 速度最高比 GPU 系統快 30 倍;但呢個數字未有獨立、完全對等嘅基準測試支持。[5][10] 每枚 WSE 3 Turbo 保留 900,000 個 AI 核心及 44GB 晶圓上 SRAM;據報告,計算、記憶體頻寬及 I/O 頻寬較上一代 WSE 3 大幅提升。[3][4]
CS 4 最有吸引力嘅地方係低延遲 LLM 解碼,而唔係單靠峰值 FLOPS 證明全面勝過 Nvidia;實際表現仍取決於模型、批次大小、精度、上下文長度、稀疏度及軟件支援。