WSE-3 Turbo pula diterangkan sebagai versi WSE-3 yang dipacu pada kelajuan lebih tinggi. Berdasarkan laporan yang tersedia, ia mengekalkan 900,000 teras, 44 GB SRAM dan proses pembuatan 5 nanometer yang sama, tetapi meningkatkan prestasi operasi.
Angka utama yang diumumkan Cerebras dan dilaporkan berhubung CS-4 termasuk:
Perbandingan The Register melaporkan bahawa WSE-3 Turbo meningkatkan pengkomputeran FP16 jarang daripada 125 kepada 250 petaflop bagi setiap wafer. Lebar jalur memori pula meningkat daripada 21.6 kepada 43.2 PB/s, manakala I/O meningkat daripada 1.2 kepada 2.4 Tb/s. Ia turut menyenaraikan 25 petaflop pengkomputeran FP16 padat untuk pemproses Turbo.
Namun, angka ini merujuk kepada keupayaan teori atau angka yang dilaporkan vendor. Ia bukan ukuran sejagat bagi prestasi aplikasi. Jumlah FLOPS puncak sesebuah rak tidak secara automatik bertukar menjadi kadar token sesaat yang sama untuk setiap model dan konfigurasi perkhidmatan.
Sistem berasaskan GPU lazimnya mengagihkan kerja model kepada banyak pemproses berasingan. Pendekatan ini boleh diskalakan dengan baik, tetapi ia memerlukan data dipindahkan antara cip serta pengiraan diselaraskan melalui lapisan memori dan rangkaian.
Pendekatan wafer-scale Cerebras pula meletakkan sejumlah besar teras pengkomputeran dan rangkaian SRAM pada satu pemproses. Cerebras menyatakan WSE-3 menggunakan SRAM terus pada cip, berbanding bergantung pada memori HBM di luar cip yang lazim digunakan oleh GPU.
Kelebihan yang disasarkan ialah pengurangan kos komunikasi ketika proses penyahkodan (decoding) token demi token. Dalam chatbot, setiap token yang dijana boleh terkesan oleh kelewatan capaian memori dan penyelarasan antara cip.
Sebab itu CS-4 paling menarik untuk kelajuan respons bagi setiap pengguna, khususnya dalam aplikasi interaktif. Ini lebih tepat dilihat sebagai cabaran khusus kepada Nvidia — bukannya bukti bahawa sistem wafer-scale lebih baik untuk semua beban kerja AI. Latihan model, inferens kelompok berskala besar, saiz model, keperluan memori dan keserasian perisian semuanya boleh mengubah keputusan perbandingan.
Cerebras memasarkan CS-4 sebagai sistem yang menawarkan inferens sehingga 30 kali lebih pantas berbanding sistem GPU. Liputan pelancaran menjelaskan bahawa perbandingan itu dibuat berdasarkan token sesaat bagi setiap pengguna, bukannya peningkatan 30 kali ganda untuk semua jenis beban kerja.
Perbezaan ini penting. Perbandingan pemecut AI yang adil sekurang-kurangnya perlu menyatakan:
Sumber yang tersedia tidak memberikan semua butiran tersebut dalam perbandingan yang boleh diulang semula dan diaudit secara bebas. Oleh itu, angka 30 kali ganda wajar dianggap sebagai dakwaan Cerebras yang terikat pada keadaan perkhidmatan tertentu, bukan kelebihan yang dijamin berbanding setiap pemasangan Nvidia.
Angka pengkomputeran AI puncak boleh mengelirukan apabila ia menggunakan pengiraan jarang (sparse arithmetic). Satu analisis menyatakan bahawa angka 125 petaflop FP16 WSE-3 ialah angka sparse yang berdasarkan andaian nisbah sparsiti tidak berstruktur 8:1. Analisis itu menganggarkan daya pemprosesan FP16 padat sebenarnya sekitar 15.625 petaflop.
Perkara yang sama perlu diambil kira apabila menilai angka 250 petaflop sparse dan 25 petaflop padat yang dilaporkan untuk WSE-3 Turbo. Prestasi puncak sparse berguna jika model dan timbunan perisian dapat memanfaatkan corak sparsiti berkenaan dengan cekap. Ia tidak secara automatik menggambarkan daya pemprosesan LLM padat.
Dalam inferens sebenar, ukuran yang lebih berguna termasuk kependaman hujung ke hujung, kadar token sesaat yang dikekalkan, daya pemprosesan pada tahap keserentakan tertentu, penggunaan kuasa dan kos bagi setiap token yang dijana.
Keputusan juga boleh berubah mengikut saiz cache-KV, pembahagian model merentas pemproses, pengelompokan permintaan, nisbah kerja prefill berbanding decode, kuantisasi dan kematangan masa jalan perisian.
CS-4 diterangkan sebagai sistem pertama yang dibina berasaskan seni bina platform Nexus. Reuters melaporkan bahawa rak itu dijangka tersedia pada suku ketiga 2026, manakala liputan pelancaran menyebut penghantaran pertama akan bermula dalam suku semasa.
Bagaimanapun, sumber yang tersedia belum cukup untuk mengesahkan semua ciri seni bina yang disebut dalam perbincangan asal. Antaranya ialah pelaksanaan modular yang digelar “backpack”, sambungan torus 2D tanpa suis, ciri penyejukan dan penggunaan kuasa rak yang tepat, serta pelan kapasiti agregat yang telah dipastikan.
Justeru, dakwaan tersebut tidak wajar dianggap sebagai spesifikasi CS-4 yang muktamad tanpa dokumentasi lebih kukuh.
Cerebras mempunyai kerjasama yang didokumentasikan dengan Amazon Web Services (AWS) berhubung inferens terpisah. Dalam model ini, sistem AWS Trainium mengendalikan peringkat prefill, manakala sistem Cerebras CS-3 mengendalikan decoding. Kedua-duanya dihubungkan melalui rangkaian Elastic Fabric Adapter (EFA) Amazon dan ditawarkan melalui Amazon Bedrock.
Kerjasama ini menunjukkan bahawa seni bina Cerebras boleh melengkapi pemecut lain, bukan semata-mata menggantikannya. Oleh sebab prefill dan decode mempunyai ciri prestasi berbeza, sistem hibrid boleh menyerahkan setiap peringkat kepada perkakasan yang paling sesuai.
Laporan yang tersedia turut menerangkan konfigurasi AMD dan Cerebras yang dirancang untuk menggunakan GPU AMD bagi prefill dan pemproses Cerebras bagi decoding. Eksekutif Cerebras berkata susunan itu berpotensi meningkatkan daya pemprosesan sebanyak lima kali ganda, dengan penggunaan dijangka pada suku keempat 2026.
Namun, ini ialah dakwaan syarikat yang berpandangan ke hadapan, bukannya keputusan produksi yang telah disahkan secara bebas. Bukti yang tersedia menyokong kewujudan kerjasama dan kerja inferens hibrid yang dirancang, tetapi tidak membuktikan bahawa AWS atau AMD telah memberikan komitmen kepada penggunaan CS-4 pada skala tertentu atau bahawa peningkatan lima kali ganda itu akan berlaku untuk setiap pelanggan.
Belum. CS-4 ialah cabaran seni bina yang munasabah dalam segmen yang lebih khusus tetapi bernilai tinggi: penyahkodan LLM berlatensi rendah untuk pengguna interaktif.
Pemproses wafer-scale, SRAM pada wafer dan lebar jalur dalaman yang tinggi direka untuk mengurangkan kos komunikasi yang timbul apabila inferens diagihkan kepada banyak GPU berasingan.
Tetapi kedudukan Nvidia tidak ditentukan oleh angka pemecut puncak semata-mata. Ekosistem perisian, sokongan model, ketersediaan perkakasan, rangkaian, jumlah kos pemilikan dan keupayaan mengendalikan pelbagai jenis model serta beban kerja turut memainkan peranan.
Dakwaan Cerebras tentang kelajuan 30 kali ganda juga memerlukan penanda aras yang sepadan sebelum boleh dianggap sebagai kenyataan umum tentang penggantian GPU.
Kesimpulan paling berhati-hati ialah CS-4 menambah pilihan persaingan dalam inferens AI. Ia mungkin sangat menarik apabila kelajuan token bagi setiap pengguna menjadi keutamaan. Sama ada ia benar-benar lebih pantas atau lebih murah dalam sesuatu penggunaan bergantung pada beban kerja dan kaedah penanda aras yang digunakan.