WSE-3 Turbo beskrivs som en överklockad version av samma grunddesign. Enligt tillgänglig rapportering behåller den de 900 000 kärnorna, 44 GB SRAM och 5-nanometersprocessen, samtidigt som den arbetar med högre prestanda.
Cerebras och rapporteringen kring lanseringen anger följande nyckeltal för CS-4:
The Register anger att WSE-3 Turbo ökar den glesa FP16-beräkningen per wafer från 125 till 250 petaflops, minnesbandbredden från 21,6 till 43,2 PB/s och I/O-bandbredden från 1,2 till 2,4 Tb/s. För Turbo-processorn anges dessutom 25 petaflops tät FP16-beräkning.
Det här är teoretiska eller leverantörsrapporterade maxvärden – inte ett universellt mått på hur snabbt alla program körs. Ett racks maximala FLOPS-tal kan inte direkt översättas till token per sekund för varje modell och serveringskonfiguration.
I GPU-baserade system fördelas modellens arbete vanligtvis över många separata processorer. Det går att skala effektivt, men innebär också att data måste flyttas mellan chip och att beräkningarna måste samordnas via minnes- och nätverkslager.
Cerebras wafer-scale-strategi placerar i stället ett mycket stort antal beräkningskärnor och en omfattande SRAM-struktur på samma processor. Företaget säger att WSE-3 använder SRAM direkt på chipet i stället för det externa HBM-minne som ofta förknippas med GPU:er. Den tänkta vinsten är mindre kommunikationsöverhead vid avkodning token för token, där varje nytt token kan påverkas av fördröjningar i minnesåtkomst och synkronisering.
Det gör CS-4 mest intressant när svarshastigheten för den enskilda användaren är viktig – exempelvis i interaktiva chattjänster. Det är en mer avgränsad utmaning mot Nvidia än ett bevis på att wafer-scale-system är bättre för alla AI-arbetslaster. Träning, batchinferens med hög genomströmning, modellstorlek, minneskrav och mjukvarukompatibilitet kan förändra jämförelsen helt.
Cerebras marknadsför CS-4 som upp till 30 gånger snabbare än GPU-system vid inferens. Rapporteringen om lanseringen preciserar att jämförelsen gäller token per sekund och användare, inte en generell 30-faldig förbättring för alla arbetslaster.
Den skillnaden är avgörande. För att en acceleratorjämförelse ska gå att bedöma behöver man åtminstone känna till:
Det tillgängliga underlaget innehåller inte alla dessa uppgifter i en reproducerbar och oberoende granskad jämförelse. 30x-siffran bör därför ses som Cerebras eget påstående under vissa serveringsförhållanden, inte som en garanterad fördel mot varje Nvidia-installation.
Maximala AI-tal kan bli särskilt missvisande när de bygger på gles aritmetik. En analys konstaterar att WSE-3:s angivna 125 petaflops FP16 är ett glest värde baserat på ett antagande om 8:1 gleshet utan struktur. Analysen uppskattar i stället den täta FP16-genomströmningen till omkring 15,625 petaflops.
Samma sak måste tas med i beräkningen när man tolkar WSE-3 Turbos rapporterade 250 petaflops i gles FP16 och 25 petaflops i tät FP16. Gles topprestanda är relevant när modellen och mjukvarustacken effektivt kan utnyttja rätt typ av gleshet. Den beskriver däremot inte automatiskt genomströmningen för en tät språkmodell.
För praktisk inferens är andra mått mer användbara: total svarstid, varaktigt antal token per sekund, genomströmning vid en definierad samtidighet, energiförbrukning och kostnad per genererat token. Resultaten påverkas också av storleken på KV-cachen, modellparallellism, batchning, förhållandet mellan inläsning och avkodning, kvantisering och hur mogen körmiljön är.
CS-4 beskrivs som det första systemet som bygger på Cerebras plattformsarkitektur Nexus. Reuters rapporterade att racket skulle bli tillgängligt under tredje kvartalet 2026, medan rapporteringen kring lanseringen uppgav att de första leveranserna skulle börja under det aktuella kvartalet.
Det tillgängliga materialet räcker inte för att verifiera alla arkitekturdetaljer som nämnts i den ursprungliga diskussionen. Det gäller bland annat en modulär ”ryggsäcks”-konstruktion, ett switchlöst 2D-torus-nätverk, exakta uppgifter om kylning och effektförbrukning samt en fastställd plan för den sammanlagda kapaciteten. Sådana uppgifter bör inte presenteras som bekräftade CS-4-specifikationer utan starkare dokumentation.
Cerebras har redan ett dokumenterat samarbete med AWS kring så kallad dis-aggregerad inferens. I den modellen hanterar AWS Trainium-system det så kallade prefill-steget, där indatan bearbetas, medan Cerebras CS-3-system sköter avkodningen. Delarna kopplas samman via Amazons nätverksteknik Elastic Fabric Adapter och görs tillgängliga genom Amazon Bedrock.
Det är betydelsefullt eftersom det visar hur Cerebras arkitektur kan komplettera andra acceleratorer i stället för att enbart ersätta dem. Prefill och avkodning har olika prestandakaraktär, så en hybridlösning kan låta varje hårdvaruplattform sköta den del den lämpar sig bäst för.
Det tillgängliga underlaget beskriver också en konfiguration med AMD och Cerebras som ska använda AMD-GPU:er för prefill och Cerebras-processorer för avkodning. Cerebras-chefer har sagt att upplägget kan öka genomströmningen femfaldigt och att driftsättning väntas under fjärde kvartalet 2026. Det är framåtblickande uppgifter från företaget, inte oberoende verifierade resultat från produktion.
Källorna visar inte att AWS eller AMD har bundit sig till en specifik CS-4-installation i en angiven skala. De stöder att partnerskap och planerade hybrida inferenslösningar finns, men inte att varje kund garanteras ett visst lyft i genomströmning.
Inte i nuläget. CS-4 är en trovärdig arkitektonisk utmanare inom ett smalare men värdefullt område: LLM-avkodning med låg fördröjning för interaktiva användare. Wafer-scale-processorn, SRAM-minnet på chipet och den höga interna bandbredden är utformade för att minska kommunikationskostnaderna som uppstår när inferens fördelas över många separata GPU:er.
Men Nvidias ställning avgörs inte enbart av acceleratorernas toppsiffror. Mjukvaruekosystem, modellstöd, tillgänglighet, nätverk, totalkostnad och förmågan att köra många olika modeller och typer av arbetslaster är minst lika viktiga. Även Cerebras 30x-påstående behöver testas i matchade benchmark innan det kan användas som ett generellt argument för att GPU:er håller på att trängas undan.
Den mest hållbara slutsatsen är att CS-4 breddar alternativen för AI-inferens. Systemet kan vara särskilt attraktivt när snabb token-generering per användare är högsta prioritet. Om det faktiskt blir snabbare eller billigare i en viss driftsmiljö avgörs däremot av arbetslasten och av hur jämförelsen genomförs.