Ox Alpha ialah GLM 5.3 Flash, yang disahkan Z.ai pada 26 Ogos 2026 selepas enam hari ujian tanpa nama. Model ini menggunakan seni bina mixture of experts dengan 320 bilion parameter keseluruhan, tetapi hanya 18 bilion diaktifkan bagi setiap token, serta konteks sehingga 1,048,576 token.
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Z.ai’s GLM-5.3-Flash, and how did it resolve the week-long mystery surrounding the anonymously released “Ox Alpha” model—covering it. Article summary: GLM-5.3-Flash is Z.ai (Zhipu AI)’s open-weight, natively multimodal GLM-5 model—and the company confirmed on August 26 that it was the previously anonymous “Ox Alpha.” The reveal turned a six-day public stress test into . Topic tags: general, general web, user generated, documentation, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Selama enam hari, pembangun menggunakan model AI berkuasa bernama Ox Alpha tanpa mengetahui siapa pembangunnya. Model itu muncul secara percuma dan tanpa atribusi di OpenRouter serta OpenCode pada 20 Ogos 2026, dengan tetingkap konteks sejuta token dan sokongan input multimodal. Pada 26 Ogos, Z.ai—jenama antarabangsa Zhipu AI—mengesahkan bahawa Ox Alpha sebenarnya ialah GLM-5.3-Flash, model pertama dalam siri GLM-5 yang dibina dengan keupayaan multimodal asli. 2
5
9
Pendedahan itu menukar ujian awam tanpa nama kepada pelancaran produk. GLM-5.3-Flash hadir dengan berat model terbuka di bawah lesen MIT, harga API yang rendah dan seni bina yang direka untuk menjadikan tugasan pengekodan berasaskan konteks panjang serta kerja ejen AI lebih menjimatkan. 6
7
9
Ox Alpha mula disenaraikan di OpenRouter dan OpenCode tanpa nama pembangun, dengan harga sifar, had konteks sebanyak 1,048,576 token, serta sokongan untuk teks, imej dan video. Pembangun segera mengujinya melalui ejen pengekodan, tugasan terminal dan aliran kerja yang memerlukan konteks panjang. 4
5
8
Komuniti kemudian mula mencari petunjuk. Antara tanda yang dilaporkan ialah tingkah laku tokenizer yang menyerupai model GLM dan corak mesej ralat API yang dianggap mendedahkan. Petunjuk ini mencetuskan spekulasi bahawa Zhipu AI berada di sebalik model tersebut. Z.ai akhirnya mengesahkan sendiri kaitan itu pada 26 Ogos, sambil berkata ujian tanpa nama tersebut bertujuan mengumpulkan maklum balas dunia sebenar sebelum pelancaran rasmi. 5
9
Ujian itu mencatat penggunaan yang luar biasa tinggi. Satu laporan pada ketika itu menyebut 42 trilion token diproses dalam tempoh enam hari, manakala laporan lain merujuk kira-kira 44 trilion token dan 503,000 pengguna OpenCode. Angka-angka ini datang daripada laporan serta titik pengukuran yang berbeza, jadi ia tidak wajar dianggap sebagai satu angka tunggal yang telah disahkan secara bebas. 8
11
16
GLM-5.3-Flash ialah model dengan berat terbuka yang dibangunkan untuk pengekodan, tugas ejen jangka panjang dan aliran kerja multimodal. Z.ai menyifatkannya sebagai model pertama dalam keluarga GLM-5 yang mempunyai keupayaan multimodal asli. Dokumentasinya menyenaraikan input visual dan tetingkap konteks sejuta token, membolehkan satu tugasan merangkumi repositori kod besar, dokumen, tangkapan skrin dan pelbagai input lain. 7
20
Ciri utama model ini ialah seni bina mixture-of-experts (MoE) dengan 320 bilion parameter, dengan hanya 18 bilion parameter diaktifkan bagi setiap token. Ringkasnya, model ini mempunyai kapasiti pembelajaran yang besar, tetapi setiap token hanya diproses melalui sebahagian daripada keseluruhan rangkaian. Z.ai turut menyatakan bahawa ia menggabungkan perhatian sparse dan linear untuk mengurangkan keperluan pengiraan serta cache key-value ketika inferens. 6
20
Reka bentuk inilah yang menjelaskan penjenamaan “Flash”. Model ini bukan model kecil, tetapi ia disasarkan untuk menawarkan kos penyajian yang lebih rendah berbanding model padat yang mempunyai jumlah parameter sama. Seni bina tersebut boleh mengurangkan pengiraan bagi setiap token, namun kelajuan dan kos sebenar tetap bergantung pada perkakasan, perisian penyajian, pengumpulan permintaan dan jenis beban kerja.
Z.ai melaporkan skor 63.4 untuk GLM-5.3-Flash dalam DeepSWE v1.1, berbanding 46.2 untuk GLM-5.2. Z.ai juga melaporkan perbandingan dalaman dengan Claude Opus 4.8, iaitu 29.0 berbanding 29.5. 7
8
Angka ini memberikan petunjuk awal, tetapi bukan kedudukan mutlak tentang kualiti model. Skor DeepSWE ialah dakwaan penanda aras yang dilaporkan vendor, manakala perbandingan dengan Claude diterangkan sebagai penilaian dalaman. Perbezaan pada arahan, penggunaan alat, rangka kerja ejen, pencemaran data ujian dan kaedah pemarkahan boleh mempengaruhi keputusan dengan ketara. Ujian bebas yang boleh diulang masih diperlukan sebelum model ini dianggap setara secara menyeluruh dengan mana-mana sistem AI tertutup terkemuka.
Bagi pembangun, persoalan yang lebih praktikal ialah kesesuaian dengan aliran kerja. Model ini berjanji untuk memeriksa repositori besar, memahami konteks visual dan melaksanakan tugasan ejen yang panjang tanpa perlu kerap meringkaskan semula sejarah tugasan. Prestasi dalam pengeluaran tetap bergantung pada kebolehpercayaan, penggunaan alat, kependaman dan keupayaan memulihkan kesilapan—bukan skor penanda aras semata-mata.
Z.ai mengumumkan harga senarai API sebanyak AS$0.15 bagi setiap juta token input dan AS$0.50 bagi setiap juta token output. Dokumentasi syarikat kemudiannya menyenaraikan promosi sementara sebanyak 50 peratus, yang menurunkan harga tersebut masing-masing kepada AS$0.075 dan AS$0.25 sepanjang tempoh promosi yang dinyatakan. 2
Berat model itu diterbitkan di Hugging Face di bawah lesen MIT, menjadikan pelepasan ini lebih terbuka berbanding model yang hanya boleh digunakan melalui perkhidmatan hos. Secara umum, lesen MIT membenarkan penggunaan komersial dan pengubahsuaian, tetapi pasukan yang mahu menggunakannya masih perlu menyemak teks lesen sebenar, terma model, kebergantungan, keperluan perkakasan dan kewajipan bagi setiap jenis penggunaan. 2
9
Dokumentasi Z.ai turut menyenaraikan GLM-5.3-Flash dalam ekosistem pelan pembangun dan pengekodannya. Rujukan API pula menerangkan sokongan input chat multimodal serta penggunaan alat. 17
20
21
Pelancaran ini membawa satu lagi cerita penting selain spesifikasi model. Z.ai berkata pratonton tanpa nama Ox Alpha disajikan sepenuhnya menggunakan pemecut AI buatan China, dengan timbunan penyajian berasaskan SGLang yang telah diubah suai. Bahan kejuruteraan syarikat menggambarkan pelaksanaan itu sebagai usaha meningkatkan kecekapan inferens pada perkakasan domestik.
Sesetengah laporan sekunder mengulangi dakwaan bahawa timbunan yang diubah suai itu meningkatkan prestasi hujung ke hujung sebanyak tiga kali ganda. Namun, armada pemecut yang digunakan, perbandingan prestasi yang tepat dan sejauh mana pelaksanaan itu bebas daripada komponen asing belum diaudit secara bebas dalam sumber yang tersedia di sini. 10
Perbezaan antara dakwaan syarikat dan pengesahan bebas ini penting. Jika disahkan, pelaksanaan tersebut akan mempunyai kepentingan strategik terhadap usaha China membina perkhidmatan AI berkeupayaan tinggi di tengah-tengah sekatan eksport cip Amerika Syarikat. Buat masa ini, ia lebih wajar difahami sebagai pendedahan penting daripada Z.ai, bukannya bukti muktamad bahawa perkakasan domestik China telah menutup jurang infrastruktur secara keseluruhan.
Strategi Ox Alpha memberikan Z.ai sesuatu yang sukar diperoleh melalui pelancaran biasa: penggunaan berskala besar dan tidak tersusun daripada pembangun yang tidak mengetahui identiti model. Pengguna mengujinya dalam ejen pengekodan dan tugasan konteks panjang kerana ia percuma serta kelihatan berkeupayaan tinggi—bukan semata-mata kerana helaian spesifikasi pemasaran. Z.ai berkata matlamatnya adalah mengumpulkan maklum balas sebelum pelancaran rasmi. 5
9
Pendekatan itu juga selari dengan strategi pengedaran berat model terbuka. Dengan menggabungkan lesen yang permisif, harga API rendah dan akses pembangun yang luas, Z.ai boleh menggalakkan percubaan, mengumpulkan maklum balas dan membina penggunaan di luar corong langganan model tertutup yang konvensional. Eksperimen model tanpa nama terdahulu, termasuk ujian Pony Alpha yang dilaporkan, menunjukkan bahawa pendekatan ini mungkin bukan idea terpencil, walaupun sumber yang tersedia memberikan maklumat terhad tentang projek tersebut.
GLM-5.3-Flash tidak dengan sendirinya membuktikan bahawa Z.ai telah menguasai keseluruhan barisan hadapan AI. Bukti paling kukuh setakat ini ialah gabungan spesifikasi yang diterbitkan, pratonton awam yang menerima penggunaan luar biasa tinggi, serta dakwaan penanda aras dan infrastruktur daripada syarikat. Penilaian bebas dan penggunaan produksi yang berterusan akan menentukan kedudukannya dalam pengekodan, penaakulan multimodal, penggunaan alat, kependaman dan kebolehpercayaan.
Namun, isyarat persaingannya jelas. Model dengan konteks sejuta token, input multimodal asli, berat terbuka dan harga API yang diukur dalam sen bagi setiap juta token memberi tekanan kepada ekonomi sistem AI tertutup yang mahal. Ia juga menunjukkan bagaimana pratonton tanpa nama boleh berfungsi serentak sebagai ujian tekanan dunia sebenar dan enjin pengedaran.
Misteri Ox Alpha kini selesai: ia ialah GLM-5.3-Flash milik Z.ai. Persoalan yang lebih besar kini bersifat praktikal, bukan lagi penyiasatan identiti—sejauh mana janji kos rendah dan konteks panjang model ini dapat bertahan apabila pembangun beralih daripada pratonton percuma yang tular kepada beban kerja produksi yang konsisten.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ox Alpha ialah GLM 5.3 Flash, yang disahkan Z.ai pada 26 Ogos 2026 selepas enam hari ujian tanpa nama.
Ox Alpha ialah GLM 5.3 Flash, yang disahkan Z.ai pada 26 Ogos 2026 selepas enam hari ujian tanpa nama. Model ini menggunakan seni bina mixture of experts dengan 320 bilion parameter keseluruhan, tetapi hanya 18 bilion diaktifkan bagi setiap token, serta konteks sehingga 1,048,576 token.
Dengan input teks, imej dan video, berat model berlesen MIT serta harga API serendah AS$0.15 bagi setiap juta token input, pelancaran ini mencabar ekonomi model AI tertutup yang mahal.