Cerebras præsenterede den 18. august 2026 CS 4, et rack baseret inferenssystem med tre WSE 3 Turbo processorer. Hver WSE 3 Turbo har fortsat 900.000 kerner og 44 GB SRAM på selve waferen, mens Cerebras angiver fordoblede tal for centrale beregnings , hukommelses og I/O egenskaber sammenlignet med WSE 3.
Research answer

Create a landscape editorial hero image for this Studio Global article: How does Cerebras’s newly unveiled CS-4 rack-scale AI accelerator challenge Nvidia in AI inference, and what are its WSE-3 Turbo processor s. Article summary: Cerebras positions CS-4 as a specialized alternative to Nvidia GPU clusters for low-latency AI inference: a rack containing three wafer-scale WSE-3 Turbo processors, intended to accelerate chatbot and LLM responses. [2][. Topic tags: general, academic, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, w
Cerebras udfordrer Nvidia på et af de mest kommercielt interessante områder i AI-infrastruktur: inferens – altså den del af arbejdet, hvor en allerede trænet model genererer et svar. Den nye CS-4 er et rack-baseret system med tre WSE-3 Turbo-processorer, og Cerebras hævder, at det kan generere tokens for individuelle brugere op til 30 gange hurtigere end GPU-baserede systemer.
Påstanden gør CS-4 interessant til chatbots og andre store sprogmodeller, hvor brugeren mærker forsinkelsen direkte. Men den viser ikke, at Cerebras generelt kan erstatte Nvidia. De tilgængelige kilder underbygger de grundlæggende specifikationer og produktets positionering, mens flere detaljer om arkitektur og fremtidige planer fortsat ikke er uafhængigt bekræftet.
CS-4 er en inferensplatform i rack-størrelse – ikke en traditionel server med mange separate accelerator- eller grafikkort. Systemet bruger tre wafer-skala-processorer af typen WSE-3 Turbo og er målrettet AI-opgaver, hvor hurtig og forudsigelig token-generering er vigtig.
Designet bygger videre på WSE-3, som ifølge de tilgængelige oplysninger indeholder 4 billioner transistorer, 900.000 AI-optimerede beregningskerner og 44 GB SRAM på selve waferen. En teknisk sammenligning angiver for den tidligere WSE-3 en maksimal beregningsydelse på 125 petaflops og en hukommelsesbåndbredde på 21 petabytes i sekundet.
WSE-3 Turbo beskrives som en overclocket version af den grundlæggende WSE-3-konstruktion. De tilgængelige rapporter siger, at den bevarer de 900.000 kerner, 44 GB SRAM og 5-nanometer-produktionen, men kører med højere ydelse.
Cerebras og kilder, der beskriver lanceringen, angiver blandt andet følgende nøgletal for CS-4:
The Registers sammenligning angiver, at WSE-3 Turbo øger den sparsomme FP16-beregningsydelse pr. wafer fra 125 til 250 petaflops, hukommelsesbåndbredden fra 21,6 til 43,2 PB/s og I/O-båndbredden fra 1,2 til 2,4 Tb/s. Den angiver desuden 25 petaflops tæt FP16-beregningsydelse for Turbo-processoren.
Tallene beskriver teoretiske eller leverandøroplyste maksimumsværdier – ikke en universel måling af, hvordan systemet klarer sig i virkelige programmer. Et racks maksimale FLOPS kan ikke uden videre omsættes til tokens pr. sekund for alle modeller og driftskonfigurationer.
GPU-baserede systemer fordeler typisk modelarbejdet på mange separate processorer. Det kan være en effektiv måde at skalere på, men det kræver samtidig, at data flyttes mellem chips, og at beregninger koordineres gennem hukommelses- og netværkslag.
Cerebras' wafer-skala-strategi samler et meget stort antal beregningskerner og et omfattende SRAM-netværk på én processor. Cerebras fremhæver, at WSE-3 bruger SRAM direkte på chippen i stedet for den eksterne HBM-hukommelse, som ofte forbindes med GPU'er. Den tilsigtede fordel er mindre kommunikations- og synkroniseringsomkostning under den trin-for-trin-dekodning, hvor modellen genererer ét token ad gangen.
Det gør CS-4 mest interessant, når svarhastigheden for den enkelte bruger er afgørende. Det er en mere præcis udfordring af Nvidia end en påstand om, at wafer-skala-systemer er bedre til enhver AI-opgave. Træning, batch-inferens med høj gennemstrømning, modelstørrelse, hukommelseskrav og softwareunderstøttelse kan alle ændre resultatet af sammenligningen.
Cerebras markedsfører CS-4 som op til 30 gange hurtigere til inferens end GPU-systemer. Omtalen af lanceringen beskriver imidlertid sammenligningen specifikt som tokens pr. sekund pr. bruger – ikke som en generel 30-dobling på tværs af alle arbejdsbelastninger.
Det er en vigtig forskel. En retvisende sammenligning mellem acceleratorer bør som minimum oplyse:
De leverede kilder indeholder ikke alle disse oplysninger i en reproducerbar, uafhængigt revideret test. 30-gange-tallet bør derfor læses som Cerebras' påstand under bestemte betingelser – ikke som en garanteret fordel over enhver Nvidia-installation.
Maksimal AI-beregningsydelse kan være særligt misvisende, når den opgives for sparsomme beregninger. En analyse påpeger, at WSE-3's tal på 125 petaflops FP16 er baseret på sparsitet og en antagelse om 8:1 ikke-struktureret sparsitet. Analysen anslår derfor den tætte FP16-ydelse til omkring 15,625 petaflops.
Det samme forbehold gælder, når man fortolker WSE-3 Turbos oplyste 250 petaflops i sparsom FP16 og 25 petaflops i tæt FP16. Sparsomme maksimumstal er relevante, hvis modellen og softwaren effektivt kan udnytte den pågældende sparsitet. De beskriver ikke automatisk gennemstrømningen for en tæt stor sprogmodel.
I praksis er de mere nyttige målinger derfor svartid fra ende til ende, vedvarende tokens pr. sekund, gennemstrømning ved en fastlagt samtidighed, strømforbrug og pris pr. genereret token. Resultaterne kan også variere med størrelsen på KV-cachen, modelparallelisering, batching, forholdet mellem prefilling og dekodning, kvantisering og modenheden af runtime-softwaren.
CS-4 beskrives som det første system bygget på Cerebras' Nexus-platformarkitektur. Reuters rapporterede, at racket forventedes at blive tilgængeligt i tredje kvartal 2026, mens omtalen af lanceringen sagde, at de første leverancer ville begynde i det aktuelle kvartal.
De leverede kilder giver ikke tilstrækkeligt grundlag for at bekræfte alle de arkitekturdetaljer, der er blevet nævnt i den oprindelige diskussion. Det gælder blandt andet en modulær såkaldt “rygsæk”-konstruktion, et switchløst 2D-torus-netværk, de præcise krav til køling og strøm i racket samt en bindende plan for den samlede kapacitet. Disse påstande bør derfor ikke behandles som fastlagte CS-4-specifikationer uden mere solid dokumentation.
Cerebras har allerede et dokumenteret samarbejde med AWS om såkaldt disaggregeret inferens. Her håndterer AWS Trainium-systemer prefilling, mens Cerebras CS-3-systemer står for dekodningen. De to dele forbindes via Amazons Elastic Fabric Adapter-netværk og tilbydes gennem Amazon Bedrock.
Det er væsentligt, fordi det viser, hvordan Cerebras' arkitektur kan supplere andre acceleratorer i stedet for blot at erstatte dem. Prefilling og dekodning har forskellige ydelsesprofiler, så en hybridløsning kan placere hvert trin på den hardware, der egner sig bedst.
De leverede oplysninger beskriver også en AMD-Cerebras-konfiguration, hvor AMD-GPU'er skal håndtere prefilling, mens Cerebras-processorer står for dekodningen. Cerebras-ledere har sagt, at løsningen kan øge gennemstrømningen fem gange, og at en udrulning forventes i fjerde kvartal 2026. Det er fremadrettede virksomhedspåstande – ikke uafhængigt bekræftede resultater fra produktion.
Kilderne dokumenterer ikke, at AWS eller AMD har forpligtet sig til en CS-4-udrulning i en bestemt skala. De understøtter partnerskaber og planlagt hybrid inferens, men ikke en garanteret forbedring for alle kunder.
Ikke endnu. CS-4 er en troværdig arkitektonisk udfordring i et smallere, men værdifuldt segment: LLM-dekodning med lav svartid for interaktive brugere. Wafer-skala-processoren, SRAM'en på waferen og den høje interne båndbredde er udviklet til at begrænse de kommunikationsomkostninger, der opstår, når inferens fordeles på mange separate GPU'er.
Nvidias position afgøres dog ikke alene af de højeste accelerator-tal. Softwareøkosystem, understøttelse af modeller, tilgængelighed, netværk, samlede ejeromkostninger og evnen til at køre mange forskellige modeller og arbejdsbelastninger er mindst lige så vigtigt. Cerebras' 30-gange-påstand kræver desuden sammenlignelige benchmarks, før den kan bruges som en generel påstand om, at GPU'er bliver fortrængt.
Den mest holdbare konklusion er, at CS-4 udvider konkurrencen på AI-inferens. Systemet kan være særligt attraktivt, når hurtig token-generering for den enkelte bruger prioriteres. Om det faktisk er hurtigere eller billigere i en konkret installation, afhænger af arbejdsbelastningen og den metode, der bruges til at måle den.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Cerebras præsenterede den 18. august 2026 CS 4, et rack baseret inferenssystem med tre WSE 3 Turbo processorer.
Cerebras præsenterede den 18. august 2026 CS 4, et rack baseret inferenssystem med tre WSE 3 Turbo processorer. Hver WSE 3 Turbo har fortsat 900.000 kerner og 44 GB SRAM på selve waferen, mens Cerebras angiver fordoblede tal for centrale beregnings , hukommelses og I/O egenskaber sammenlignet med WSE 3.
Den vigtigste fordel er arkitekturen: LLM dekodning på wafer skala silicium kan mindske kommunikationsomkostningerne.