Ox Alpha ialah GLM 5.3 Flash daripada Zhipu AI, yang disahkan pada 26 Ogos 2026 selepas percubaan percuma tanpa jenama bermula pada 20 Ogos. Model ini menyasarkan pengekodan, pengaturcaraan visual, tugasan ejen AI dan kerja konteks panjang, dengan konteks sekitar sejuta token serta input teks, imej, video dan fail.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Pada 20 Ogos 2026, satu model AI percuma bernama Ox Alpha muncul di OpenRouter dan beberapa alat pembangun lain tanpa nama pengeluar, kad model atau helaian spesifikasi terperinci. Enam hari kemudian, Zhipu AI—yang beroperasi di peringkat antarabangsa sebagai Z.ai—mengakui bahawa Ox Alpha sebenarnya ialah GLM-5.3-Flash. 3
4
Pendedahan itu menamatkan misteri selama seminggu dan membawa kepada pelancaran model terbuka yang agak besar: sistem mixture-of-experts (MoE) dengan 320 bilion parameter keseluruhan, hanya 18 bilion parameter aktif bagi setiap token, konteks sekitar sejuta token, input multimodal asli dan pemberat yang dikeluarkan di bawah lesen MIT. 3
6
8
Ox Alpha diperkenalkan secara “buta”—pengguna boleh mengujinya, tetapi tidak diberitahu siapa pembangunnya atau berapa besar model tersebut. Pembangun mula mencubanya untuk menulis kod, membina aliran kerja ejen dan memproses input visual. Prestasi praktikalnya menarik perhatian sehingga timbul spekulasi bahawa ia mungkin datang daripada makmal AI terkemuka. 13
16
Menurut Zhipu, identiti dan spesifikasi model sengaja dirahsiakan supaya pembangun menilai hasil kerja model, bukan terpengaruh oleh reputasi jenama, jumlah parameter atau gembar-gembur pelancaran. Penggunaan sebenar itu turut memberi syarikat corak trafik dan maklum balas daripada tugasan pembangunan perisian serta ejen AI sebelum pengumuman rasmi. 13
15
Laporan media menyebut kapasiti percuma sekitar 100 trilion token sehari sepanjang tempoh ujian. Patrick Collison, pengasas bersama Stripe, juga antara pembangun terkenal yang dilaporkan memuji kualiti model itu. Reaksi sedemikian membantu menjadikan endpoint tanpa nama tersebut sebagai pelancaran yang paling diperhatikan, walaupun pujian pengguna tidak sama dengan penilaian terkawal. 13
14
Zhipu turut menyatakan bahawa perkhidmatan itu berjalan pada pemecut AI buatan China. South China Morning Post melaporkan penggunaan kelompok 100,000 cip sedemikian dan 62 trilion token yang diproses sebelum pelancaran rasmi. Angka kapasiti dan penggunaan berbeza mengikut laporan, jadi ia wajar dianggap sebagai angka yang dilaporkan syarikat atau media, bukannya ukuran yang diaudit secara bebas. 7
13
GLM-5.3-Flash ialah model mixture-of-experts, atau MoE. Ia mempunyai kumpulan 320 bilion parameter, tetapi hanya 18 bilion diaktifkan untuk menghasilkan setiap token. Secara ringkas, pendekatan ini cuba menawarkan kapasiti representasi model yang sangat besar tanpa menggunakan kesemua parameter pada setiap langkah inferens. 3
4
Model ini mempunyai 45 lapisan dan merupakan model pertama dalam siri GLM-5 yang digambarkan sebagai multimodal secara asli. Ia direka untuk mengendalikan teks, imej, video, dokumen visual, fail dan input multimodal yang diselang-seli. Keupayaan ini berguna apabila ejen perlu melihat antara muka, mentafsir tangkap layar, membaca dokumen atau menilai hasil kod—bukan sekadar memproses teks. 4
11
Zhipu mengiklankan 1,048,576 token, lazimnya diringkaskan sebagai konteks sejuta token. Ruang konteks ini menyasarkan repositori perisian yang besar, sesi ejen yang panjang, himpunan dokumen dan tugasan yang menggabungkan kod dengan bahan visual atau fail. 3
4
Model ini dilatih daripada asas baharu menggunakan seni bina dan resipi latihan yang direka semula. Zhipu melaporkan penggunaan korpus multimodal sebanyak 30 trilion token, menunjukkan bahawa GLM-5.3-Flash bukan sekadar versi GLM-5.3 yang dikecilkan, sebaliknya model baharu yang dibina dengan tumpuan pada kecekapan dan keupayaan multimodal. 4
16
GLM-5.3-Flash menggabungkan perhatian linear dengan perhatian jarang. Perhatian linear bertujuan menjadikan pemprosesan hubungan jarak jauh dalam urutan lebih murah, manakala perhatian jarang memilih interaksi tertentu yang memerlukan ketepatan lebih tinggi. Gabungan ini direka untuk menyeimbangkan keupayaan konteks panjang dengan kos inferens yang lebih terkawal. 4
16
Zhipu turut memperkenalkan mekanisme IndexPool bagi mengurangkan beban memori dan kependaman ketika pengindeksan pada konteks yang sangat panjang. Seni bina itu juga menggunakan manifold-constrained hyper-connections sebagai satu lagi teknik untuk meningkatkan kecekapan penskalaan. Nilai sebenar teknik ini tetap bergantung pada konfigurasi pelayan, panjang urutan, perkakasan dan jenis beban kerja. 4
16
Berbanding GLM-5.3, Zhipu mendakwa GLM-5.3-Flash mengurangkan pengiraan perhatian sebanyak 3.01 kali ganda dan penggunaan cache KV sebanyak 4.44 kali ganda, sambil mengekalkan kualiti konteks panjang. Cache KV ialah memori yang menyimpan maklumat token terdahulu semasa model menjana jawapan; dalam ejen yang berjalan lama, penggunaan memori ini boleh menjadi kesesakan utama. Namun, nisbah tersebut datang terutamanya daripada bahan teknikal Zhipu sendiri dan tidak sepatutnya dianggap sebagai peningkatan kelajuan sejagat yang telah disahkan secara bebas. 4
Model ini terutama disasarkan kepada pengekodan, pengaturcaraan visual, tugasan ejen jangka panjang dan penggunaan alat. Keupayaan visual aslinya membolehkan ejen memerhati antara muka, hasil pemaparan dan maklum balas interaksi, lalu mewujudkan gelung kerja antara kod, pelayar web dan antara muka grafik. 4
Keputusan yang dilaporkan Zhipu termasuk:
Angka ini selari dengan kedudukan GLM-5.3-Flash sebagai model untuk kejuruteraan perisian dan ejen AI. Namun, perbandingan antara model perlu dibuat dengan berhati-hati kerana penanda aras ejen sangat dipengaruhi oleh arahan, alat, rangka kerja sokongan, perkakasan, had masa dan versi penilaian. Buat masa ini, angka tersebut paling tepat difahami sebagai keputusan yang dilaporkan Zhipu, bukannya ranking muktamad semua model pesaing. 4
15
Zhipu menerbitkan pemberat GLM-5.3-Flash di Hugging Face di bawah lesen MIT, termasuk keluaran BF16. Dokumentasi model menyenaraikan sokongan penggunaan melalui rangka kerja seperti SGLang dan vLLM, membolehkan organisasi menjalankannya secara setempat atau mengurus pelayan sendiri tanpa bergantung sepenuhnya pada API Z.ai. 3
6
8
Keterbukaan ini memberi pembangun peluang untuk menguji model menggunakan repositori kod, dokumen, antara muka visual dan persekitaran ejen mereka sendiri. Pasukan infrastruktur juga boleh menilai kos penyajian dan keperluan perkakasan secara langsung.
Bagaimanapun, model ini bukan ringan secara automatik. Jumlah 320 bilion parameter masih menjadikan penggunaan checkpoint penuh satu tugasan kejuruteraan yang besar. Reka bentuk 18 bilion parameter aktif mengurangkan kerja pengiraan bagi setiap token, tetapi tidak menghapuskan keperluan memori dan perkakasan untuk memuatkan model tersebut.
Eksperimen Ox Alpha bukan sekadar aksi publisiti. Ia menguji sama ada pembangun akan terus menggunakan model apabila nama syarikat, jumlah parameter dan identitinya disembunyikan. Pengguna sebenar memberikan beban kerja serta reaksi sebelum pelancaran rasmi, lalu menghasilkan bentuk maklum balas produk yang jarang berlaku dalam industri AI. 13
15
Namun, pendekatan ini mempunyai had. Akses percuma boleh menarik trafik luar biasa, pujian awam mungkin dipengaruhi faktor kebaharuan, dan ujian tanpa nama tidak semestinya mengawal arahan atau membandingkan semua model dalam keadaan yang sama.
Kesimpulan paling kukuh ialah GLM-5.3-Flash berjaya menarik minat besar daripada pembangun sebelum identitinya diketahui. Zhipu kemudian menggunakan minat dan maklum balas itu untuk menyokong pelancaran model terbuka tersebut. Penilaian bebas dan boleh diulang masih diperlukan untuk menentukan sejauh mana dakwaan seni bina, kecekapan dan penanda aras itu diterjemahkan kepada prestasi dalam pengeluaran.
GLM-5.3-Flash ialah identiti sebenar di sebalik Ox Alpha—model GLM terbuka dan multimodal asli yang dibina untuk pengekodan serta tugasan ejen. Spesifikasi utamanya ialah reka bentuk MoE 320 bilion parameter keseluruhan dengan 18 bilion parameter aktif, 45 lapisan, konteks sejuta token, perhatian linear dan jarang, serta pemberat berlesen MIT. 3
4
11
Nilai utama model ini bukan semata-mata pada skala. Gabungan konteks panjang, input visual, penggunaan alat dan dakwaan kos penyajian yang lebih rendah—dalam model yang boleh dimuat turun dan dijalankan sendiri—itulah yang menjadikan GLM-5.3-Flash menarik perhatian. Ujian buta Ox Alpha pula memberikan maklum balas dunia sebenar yang luar biasa, tetapi belum menggantikan penilaian bebas untuk mengesahkan prestasi dalam penggunaan sebenar.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha ialah GLM 5.3 Flash daripada Zhipu AI, yang disahkan pada 26 Ogos 2026 selepas percubaan percuma tanpa jenama bermula pada 20 Ogos.
Ox Alpha ialah GLM 5.3 Flash daripada Zhipu AI, yang disahkan pada 26 Ogos 2026 selepas percubaan percuma tanpa jenama bermula pada 20 Ogos. Model ini menyasarkan pengekodan, pengaturcaraan visual, tugasan ejen AI dan kerja konteks panjang, dengan konteks sekitar sejuta token serta input teks, imej, video dan fail.
GLM 5.3 Flash mempunyai 320 bilion parameter keseluruhan tetapi hanya mengaktifkan 18 bilion bagi setiap token, manakala pemberatnya dikeluarkan di bawah lesen MIT.