Pada 26 Ogos 2026, Zhipu AI mengesahkan model misteri Ox Alpha, atau “Niu Lai”, ialah GLM 5.3 Flash — model mixture of experts sumber terbuka dengan keupayaan multimodal asli. Ujian percuma tanpa nama di OpenRouter dan OpenCode menarik lebih 50 trilion token dalam tempoh lima hari, sebelum jumlah penggunaan dilapork...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Pada 26 Ogos 2026, Zhipu AI — yang turut menggunakan jenama Z.ai — akhirnya mendedahkan identiti model AI misteri yang sebelum ini beroperasi secara senyap di bawah nama Ox Alpha atau “Niu Lai”. Model itu ialah GLM-5.3-Flash, sebuah model mixture-of-experts (MoE) dengan pemberat terbuka dan keupayaan multimodal asli. 1
4
6
Sebelum pelancaran rasmi, GLM-5.3-Flash diuji secara percuma tanpa mendedahkan pembangunnya di platform pembangun OpenRouter dan OpenCode. Sambutan pengguna amat besar: laporan meletakkan jumlah penggunaan melebihi 50 trilion token dalam tempoh lima hari, kemudian meningkat kepada lebih 60 trilion token dalam enam hari. Model itu turut menduduki tempat teratas carta penggunaan kedua-dua platform dan pada kemuncaknya dilaporkan mencatat lebih dua kali ganda penggunaan model DeepSeek yang setara. 3
Dalam konteks model AI, token ialah unit kecil teks yang diproses oleh sistem — misalnya sebahagian perkataan, tanda baca atau aksara. Jumlah token yang tinggi menunjukkan skala permintaan inferens, iaitu proses model menjana jawapan selepas menerima arahan pengguna.
Zhipu berkata perkhidmatan percubaan itu berjalan sepenuhnya pada kelompok lebih 100,000 cip AI buatan China. Selepas pengoptimuman perisian dan sistem, syarikat itu mendakwa kecekapan perkakasan serta kos bagi setiap token adalah setanding dengan GPU Nvidia arus perdana. 3
6
Namun, Zhipu tidak menamakan pembekal cip secara rasmi. Huawei, Moore Threads dan Hygon disebut dalam beberapa laporan sebagai kemungkinan pembekal, tetapi perkara itu masih spekulasi yang belum disahkan oleh Zhipu. 40
Pendedahan ini penting, tetapi ia tidak membuktikan bahawa China secara keseluruhannya sudah menyamai perkakasan Nvidia, atau kos inferens cip domestik sentiasa sama dengan GPU Nvidia. Apa yang ditunjukkan ialah beban kerja inferens berskala besar dan dunia sebenar boleh dikendalikan menggunakan kelompok cip bukan Nvidia melalui kejuruteraan sistem yang rumit. 3
6
Nvidia mempunyai kelebihan besar melalui CUDA — platform perisian, alat pembangunan dan ekosistem yang digunakan secara meluas untuk pengkomputeran AI. Prestasi GLM-5.3-Flash menunjukkan bahawa timbunan perisian khusus model dan enjin inferens boleh mengurangkan kebergantungan kepada CUDA bagi sesetengah beban kerja inferens dalam pengeluaran.
Bagaimanapun, ini tidak bermakna kelebihan CUDA sudah terhapus. Bukti yang ada belum mencukupi untuk membuat kesimpulan lebih luas mengenai ekosistem pembangun, alatan, latihan model atau semua jenis aplikasi AI.
Menurut laporan teknikal, enjin inferens berasaskan SGLang yang digunakan Zhipu menggabungkan beberapa teknik, termasuk kuantisasi W8A8, kuantisasi cache campuran INT8/FP8/BF16, tensor parallelism dalam nod serta pemisahan Encode–Prefill–Decode (EPD) kepada kelompok yang boleh diskalakan secara berasingan. Pendekatan ini direka untuk mengurus kekangan memori, lebar jalur, komunikasi dan penjadualan ketika memproses konteks sehingga satu juta token. 4
7
Zhipu dilaporkan berkata pengubahsuaian tersebut meningkatkan prestasi perkhidmatan hujung ke hujung kira-kira tiga kali ganda berbanding garis dasar awalnya. Dokumentasi SGLang yang diterbitkan kemudian turut menunjukkan daya pemprosesan lebih tinggi dan kapasiti cache FP8 yang jauh lebih besar berbanding konfigurasi perbandingan BF16. Namun, dokumentasi itu bukan audit bebas terhadap dakwaan peningkatan tiga kali ganda Zhipu. 2
Model ini dilaporkan memperoleh skor 57 dalam Artificial Analysis Intelligence Index, sama dengan skor yang dilaporkan untuk Claude Opus 4.8. Perbandingan itu wajar dibaca sebagai kesetaraan pada satu indeks gabungan sahaja — bukan bukti bahawa kedua-duanya memberikan prestasi sama dalam setiap penanda aras atau tugasan ejen AI. 1
GLM-5.3-Flash diposisikan untuk bersaing dengan model berkecekapan tinggi seperti DeepSeek V4 Flash dan DeepSeek V4 Pro, sambil menawarkan harga inferens yang jauh lebih rendah. Namun, bukti yang tersedia belum mencukupi untuk mengesahkan perbandingan tepat bagi setiap penanda aras antara model-model tersebut.
Harga API yang diterbitkan untuk GLM-5.3-Flash ialah:
Laporan ketika itu menyifatkan harga berkenaan kira-kira satu persepuluh daripada harga GLM-5.3 dan sekitar satu perempat puluh harga Claude Opus 4.8. Namun, nisbah tersebut bergantung pada arah token — input atau output — tahap panjang konteks serta pelan harga yang dibandingkan. 1
Kesimpulan terbesar daripada pendedahan ini bukan sekadar nama sebenar Ox Alpha. Ia menunjukkan bagaimana model berskala besar boleh digabungkan dengan pengoptimuman inferens yang agresif dan perkakasan domestik untuk menawarkan prestasi tinggi pada harga rendah. Tetapi sejauh mana pendekatan itu boleh diperluas kepada semua model dan beban kerja AI masih belum terbukti.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pada 26 Ogos 2026, Zhipu AI mengesahkan model misteri Ox Alpha, atau “Niu Lai”, ialah GLM 5.3 Flash — model mixture of experts sumber terbuka dengan keupayaan multimodal asli.
Pada 26 Ogos 2026, Zhipu AI mengesahkan model misteri Ox Alpha, atau “Niu Lai”, ialah GLM 5.3 Flash — model mixture of experts sumber terbuka dengan keupayaan multimodal asli. Ujian percuma tanpa nama di OpenRouter dan OpenCode menarik lebih 50 trilion token dalam tempoh lima hari, sebelum jumlah penggunaan dilaporkan melepasi 60 trilion token pada hari keenam.
Zhipu berkata keseluruhan perkhidmatan itu dijalankan menggunakan kelompok lebih 100,000 cip AI buatan China, dengan kecekapan perkakasan dan kos setiap token yang dikatakan setanding GPU Nvidia arus perdana.