Pada 26 Ogos 2026, Z.ai mengesahkan bahawa pratonton percuma tanpa nama, Ox Alpha, ialah GLM 5.3 Flash—model 320 bilion parameter dengan 18 bilion parameter aktif setiap token dan lesen MIT. Model ini menerima input teks, imej dan video, menawarkan konteks kira kira satu juta token, serta berharga AS$0.15 bagi setia...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Pada 26 Ogos 2026, teka-teki itu akhirnya terjawab: Z.ai mengesahkan bahawa Ox Alpha, model tanpa nama yang ditawarkan melalui OpenRouter dan OpenCode, sebenarnya ialah GLM-5.3-Flash. Z.ai memperkenalkannya sebagai model pertama dalam keluarga GLM-5 yang menyokong multimodal secara natif, dengan pemberat terbuka, tetingkap konteks satu juta token dan tumpuan kepada pengekodan serta tugasan ejen AI yang berjalan dalam tempoh panjang. 15
40
Namun, kisah pentingnya bukan sekadar identiti model tersebut. Ox Alpha menggabungkan pratonton percuma tanpa nama dengan penggunaan besar-besaran oleh pembangun, sebelum ditukar menjadi produk rasmi yang mempunyai nama dan boleh dimuat turun. Pendekatan ini membolehkan Z.ai menguji infrastrukturnya melalui beban kerja sebenar, sambil membina rasa ingin tahu terhadap pelancaran akhirnya.
GLM-5.3-Flash ialah model mixture-of-experts (MoE) dengan 320 bilion jumlah parameter, tetapi hanya 18 bilion parameter aktif bagi setiap token. Ia menerima input teks, imej dan video secara natif, manakala outputnya berbentuk teks. Kapasiti konteks yang disenaraikan adalah kira-kira satu juta token, walaupun had tepat berbeza mengikut platform: dokumentasi Z.ai menerangkan reka bentuk satu juta token, manakala OpenRouter menyenaraikan tetingkap konteks sebanyak 1,310,720 token. 1
2
3
40
Z.ai mengeluarkan pemberat model di bawah Lesen MIT, menjadikannya lebih mudah digunakan dan dihoskan sendiri berbanding sistem yang hanya boleh diakses melalui API tertutup. Selepas pratonton tanpa nama berakhir, model ini turut disenaraikan di OpenRouter menggunakan nama rasminya. 3
4
8
Pelancaran ini tidak patut dikelirukan dengan produk GLM-5.3 yang lebih besar, yang diumumkan lebih awal pada Ogos. Laporan yang tersedia menggambarkan GLM-5.3-Flash sebagai model berasingan, iaitu model 320B-A18B dengan kos lebih rendah—bukan SKU yang sama dengan barisan GLM-5.3 berskala lebih besar. 10
Z.ai mendakwa GLM-5.3-Flash menawarkan prestasi lebih baik berbanding GLM-5.2, sambil mengurangkan kos penyampaian model. Dalam keputusan yang dipetik sekitar pelancaran, model itu memperoleh 63.4 dalam DeepSWE v1.1, berbanding 46.2 untuk GLM-5.2. Z.ai turut melaporkan skor 29.0 dalam penanda aras pengekodan dalaman, hampir dengan 29.5 yang dilaporkan untuk Claude Opus 4.8. 3
16
Angka ini berguna untuk memahami kedudukan yang cuba dibina oleh Z.ai, tetapi ia bukan pengesahan bebas bahawa model tersebut setanding dengan model Anthropic. Takrif penanda aras, tetapan penilaian, arahan yang digunakan dan kebolehulangan keputusan semuanya penting. Kesimpulan paling selamat ialah Z.ai mendakwa mempunyai prestasi kukuh untuk pengekodan dan tugasan ejen pada kos jauh lebih rendah—bukan bahawa GLM-5.3-Flash telah terbukti mengatasi semua sistem AI termaju yang tertutup.
Ciri paling menarik Ox Alpha ialah pembangun boleh mencubanya tanpa bayaran sepanjang tempoh pratonton tanpa nama. Fasa itu berakhir apabila model tersebut menerima identiti rasmi. Harga senarai yang dilaporkan Z.ai ialah AS$0.15 bagi setiap juta token input dan AS$0.50 bagi setiap juta token output. 1
3
Pada sekitar waktu pelancaran, OpenRouter memaparkan kadar promosi yang lebih rendah, iaitu AS$0.075 bagi setiap juta token input dan AS$0.25 bagi setiap juta token output. 2 Perbezaan ini penting: pratonton percuma, harga senarai Z.ai dan diskaun pelancaran khusus platform ialah tiga keadaan akses yang berbeza.
Walaupun pada harga senarai, faktor ekonomi menjadi sebahagian besar daya tarikan model ini. Ejen pengekodan boleh menggunakan konteks dan output dalam jumlah besar. Oleh itu, kos token yang rendah mungkin mempengaruhi pemilihan model sama seperti perbezaan kecil dalam keputusan penanda aras.
Z.ai berkata GLM-5.3-Flash beroperasi sepenuhnya menggunakan pemecut AI buatan China. 15 Laporan mengenai sistem penyampaiannya menyebut susunan berasaskan SGLang yang diubah suai, bersama teknik seperti pengkuantuman, tensor parallelism, format cache bercampur, pemisahan lapisan dan seni bina encode–prefill–decode yang berasingan. Matlamat yang dilaporkan adalah untuk meningkatkan prestasi penyampaian dari hujung ke hujung sambil beroperasi dalam batasan perkakasan domestik.
25
Perkembangan ini melanjutkan naratif Z.ai sebelum ini mengenai keluarga GLM. Syarikat itu pernah menyatakan bahawa keluarga GLM-5 dilatih menggunakan pemproses Huawei Ascend tanpa perkakasan Nvidia. Laporan turut menyebut bahawa Z.ai berada dalam U.S. Entity List, yang mengehadkan aksesnya kepada pemecut Nvidia H100, H200 dan B200. 26
Dakwaan berkaitan inferens ini mempunyai kepentingan strategik, tetapi ia wajar dibaca sebagai laporan syarikat dan industri, bukannya perbandingan prestasi perkakasan yang diaudit sepenuhnya. Kesimpulan yang lebih kukuh ialah Z.ai sedang menunjukkan bahawa timbunan modelnya mampu menyampaikan model multimodal berskala besar tanpa bergantung pada GPU pusat data Nvidia yang paling maju.
Pelancaran tanpa nama itu kelihatan seperti strategi yang dirancang: keluarkan model berkeupayaan tinggi tanpa mendedahkan pembangunnya, tawarkan akses percuma melalui saluran pengekodan yang popular, perhatikan cara pembangun menggunakannya, kemudian dedahkan produk selepas mendapat maklum balas dunia sebenar. Z.ai turut dikaitkan dengan ujian terdahulu bernama “Pony Alpha” yang menggunakan idea hampir sama. Dalam kes Ox Alpha, penyiasat komuniti cuba mengenal pasti model itu melalui tingkah laku tokenizer, petunjuk pemprosesan video dan corak ralat API. 7
11
13
Beberapa laporan ketika pelancaran juga menyebut jumlah penggunaan yang sangat besar serta sambutan hangat daripada pembangun. Namun, bahan yang tersedia tidak mengesahkan secara bebas setiap angka atau petikan yang dilaporkan. Dakwaan tersebut lebih wajar dianggap sebagai laporan sekitar pelancaran, bukannya data penggunaan yang diaudit. 14
GLM-5.3-Flash tidak membuktikan bahawa Z.ai telah mengatasi OpenAI atau Anthropic dalam semua keupayaan model AI termaju. Namun, ia menunjukkan gabungan yang lebih mencabar: input multimodal, konteks yang sangat panjang, pemberat terbuka berlesen MIT, pengkhususan untuk ejen pengekodan dan harga API yang rendah dalam satu produk. 15
40
Bagi pembangun, gabungan ini boleh mengurangkan kos untuk bertukar model dan menjadikan pengehosan sendiri atau penggunaan berbilang penyedia lebih praktikal. Bagi penyedia model tertutup, ia meningkatkan tekanan terhadap harga dan margin—terutamanya dalam tugasan ejen pengekodan, apabila jumlah token, kependaman, kawalan penggunaan dan ketersediaan infrastruktur mungkin sama penting dengan kedudukan dalam papan pendahulu penanda aras.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pada 26 Ogos 2026, Z.ai mengesahkan bahawa pratonton percuma tanpa nama, Ox Alpha, ialah GLM 5.3 Flash—model 320 bilion parameter dengan 18 bilion parameter aktif setiap token dan lesen MIT.
Pada 26 Ogos 2026, Z.ai mengesahkan bahawa pratonton percuma tanpa nama, Ox Alpha, ialah GLM 5.3 Flash—model 320 bilion parameter dengan 18 bilion parameter aktif setiap token dan lesen MIT. Model ini menerima input teks, imej dan video, menawarkan konteks kira kira satu juta token, serta berharga AS$0.15 bagi setiap juta token input dan AS$0.50 bagi setiap juta token output pada kadar senarai Z.ai.
Pelancaran secara senyap membolehkan Z.ai menguji sistemnya dengan trafik ejen pengekodan dunia sebenar sebelum memperkenalkan nama rasmi dan mengeluarkan pemberat model untuk dimuat turun.
Pada 26 Ogos 2026, Z.ai mengesahkan bahawa pratonton percuma tanpa nama, Ox Alpha, ialah GLM 5.3 Flash—model 320 bilion parameter dengan 18 bilion parameter aktif setiap token dan lesen MIT. Model ini menerima input teks, imej dan video, menawarkan konteks kira kira satu juta token, serta berharga AS$0.15 bagi setia...
Diterbitkan olehDisunting dengan GPT-5.6 LunaImej dijana dengan GPT Image 1.5
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Pada 26 Ogos 2026, teka-teki itu akhirnya terjawab: Z.ai mengesahkan bahawa Ox Alpha, model tanpa nama yang ditawarkan melalui OpenRouter dan OpenCode, sebenarnya ialah GLM-5.3-Flash. Z.ai memperkenalkannya sebagai model pertama dalam keluarga GLM-5 yang menyokong multimodal secara natif, dengan pemberat terbuka, tetingkap konteks satu juta token dan tumpuan kepada pengekodan serta tugasan ejen AI yang berjalan dalam tempoh panjang. 15
40
Namun, kisah pentingnya bukan sekadar identiti model tersebut. Ox Alpha menggabungkan pratonton percuma tanpa nama dengan penggunaan besar-besaran oleh pembangun, sebelum ditukar menjadi produk rasmi yang mempunyai nama dan boleh dimuat turun. Pendekatan ini membolehkan Z.ai menguji infrastrukturnya melalui beban kerja sebenar, sambil membina rasa ingin tahu terhadap pelancaran akhirnya.
GLM-5.3-Flash ialah model mixture-of-experts (MoE) dengan 320 bilion jumlah parameter, tetapi hanya 18 bilion parameter aktif bagi setiap token. Ia menerima input teks, imej dan video secara natif, manakala outputnya berbentuk teks. Kapasiti konteks yang disenaraikan adalah kira-kira satu juta token, walaupun had tepat berbeza mengikut platform: dokumentasi Z.ai menerangkan reka bentuk satu juta token, manakala OpenRouter menyenaraikan tetingkap konteks sebanyak 1,310,720 token. 1
2
3
40
Z.ai mengeluarkan pemberat model di bawah Lesen MIT, menjadikannya lebih mudah digunakan dan dihoskan sendiri berbanding sistem yang hanya boleh diakses melalui API tertutup. Selepas pratonton tanpa nama berakhir, model ini turut disenaraikan di OpenRouter menggunakan nama rasminya. 3
4
8
Pelancaran ini tidak patut dikelirukan dengan produk GLM-5.3 yang lebih besar, yang diumumkan lebih awal pada Ogos. Laporan yang tersedia menggambarkan GLM-5.3-Flash sebagai model berasingan, iaitu model 320B-A18B dengan kos lebih rendah—bukan SKU yang sama dengan barisan GLM-5.3 berskala lebih besar. 10
Z.ai mendakwa GLM-5.3-Flash menawarkan prestasi lebih baik berbanding GLM-5.2, sambil mengurangkan kos penyampaian model. Dalam keputusan yang dipetik sekitar pelancaran, model itu memperoleh 63.4 dalam DeepSWE v1.1, berbanding 46.2 untuk GLM-5.2. Z.ai turut melaporkan skor 29.0 dalam penanda aras pengekodan dalaman, hampir dengan 29.5 yang dilaporkan untuk Claude Opus 4.8. 3
16
Angka ini berguna untuk memahami kedudukan yang cuba dibina oleh Z.ai, tetapi ia bukan pengesahan bebas bahawa model tersebut setanding dengan model Anthropic. Takrif penanda aras, tetapan penilaian, arahan yang digunakan dan kebolehulangan keputusan semuanya penting. Kesimpulan paling selamat ialah Z.ai mendakwa mempunyai prestasi kukuh untuk pengekodan dan tugasan ejen pada kos jauh lebih rendah—bukan bahawa GLM-5.3-Flash telah terbukti mengatasi semua sistem AI termaju yang tertutup.
Ciri paling menarik Ox Alpha ialah pembangun boleh mencubanya tanpa bayaran sepanjang tempoh pratonton tanpa nama. Fasa itu berakhir apabila model tersebut menerima identiti rasmi. Harga senarai yang dilaporkan Z.ai ialah AS$0.15 bagi setiap juta token input dan AS$0.50 bagi setiap juta token output. 1
3
Pada sekitar waktu pelancaran, OpenRouter memaparkan kadar promosi yang lebih rendah, iaitu AS$0.075 bagi setiap juta token input dan AS$0.25 bagi setiap juta token output. 2 Perbezaan ini penting: pratonton percuma, harga senarai Z.ai dan diskaun pelancaran khusus platform ialah tiga keadaan akses yang berbeza.
Walaupun pada harga senarai, faktor ekonomi menjadi sebahagian besar daya tarikan model ini. Ejen pengekodan boleh menggunakan konteks dan output dalam jumlah besar. Oleh itu, kos token yang rendah mungkin mempengaruhi pemilihan model sama seperti perbezaan kecil dalam keputusan penanda aras.
Z.ai berkata GLM-5.3-Flash beroperasi sepenuhnya menggunakan pemecut AI buatan China. 15 Laporan mengenai sistem penyampaiannya menyebut susunan berasaskan SGLang yang diubah suai, bersama teknik seperti pengkuantuman, tensor parallelism, format cache bercampur, pemisahan lapisan dan seni bina encode–prefill–decode yang berasingan. Matlamat yang dilaporkan adalah untuk meningkatkan prestasi penyampaian dari hujung ke hujung sambil beroperasi dalam batasan perkakasan domestik.
25
Perkembangan ini melanjutkan naratif Z.ai sebelum ini mengenai keluarga GLM. Syarikat itu pernah menyatakan bahawa keluarga GLM-5 dilatih menggunakan pemproses Huawei Ascend tanpa perkakasan Nvidia. Laporan turut menyebut bahawa Z.ai berada dalam U.S. Entity List, yang mengehadkan aksesnya kepada pemecut Nvidia H100, H200 dan B200. 26
Dakwaan berkaitan inferens ini mempunyai kepentingan strategik, tetapi ia wajar dibaca sebagai laporan syarikat dan industri, bukannya perbandingan prestasi perkakasan yang diaudit sepenuhnya. Kesimpulan yang lebih kukuh ialah Z.ai sedang menunjukkan bahawa timbunan modelnya mampu menyampaikan model multimodal berskala besar tanpa bergantung pada GPU pusat data Nvidia yang paling maju.
Pelancaran tanpa nama itu kelihatan seperti strategi yang dirancang: keluarkan model berkeupayaan tinggi tanpa mendedahkan pembangunnya, tawarkan akses percuma melalui saluran pengekodan yang popular, perhatikan cara pembangun menggunakannya, kemudian dedahkan produk selepas mendapat maklum balas dunia sebenar. Z.ai turut dikaitkan dengan ujian terdahulu bernama “Pony Alpha” yang menggunakan idea hampir sama. Dalam kes Ox Alpha, penyiasat komuniti cuba mengenal pasti model itu melalui tingkah laku tokenizer, petunjuk pemprosesan video dan corak ralat API. 7
11
13
Beberapa laporan ketika pelancaran juga menyebut jumlah penggunaan yang sangat besar serta sambutan hangat daripada pembangun. Namun, bahan yang tersedia tidak mengesahkan secara bebas setiap angka atau petikan yang dilaporkan. Dakwaan tersebut lebih wajar dianggap sebagai laporan sekitar pelancaran, bukannya data penggunaan yang diaudit. 14
GLM-5.3-Flash tidak membuktikan bahawa Z.ai telah mengatasi OpenAI atau Anthropic dalam semua keupayaan model AI termaju. Namun, ia menunjukkan gabungan yang lebih mencabar: input multimodal, konteks yang sangat panjang, pemberat terbuka berlesen MIT, pengkhususan untuk ejen pengekodan dan harga API yang rendah dalam satu produk. 15
40
Bagi pembangun, gabungan ini boleh mengurangkan kos untuk bertukar model dan menjadikan pengehosan sendiri atau penggunaan berbilang penyedia lebih praktikal. Bagi penyedia model tertutup, ia meningkatkan tekanan terhadap harga dan margin—terutamanya dalam tugasan ejen pengekodan, apabila jumlah token, kependaman, kawalan penggunaan dan ketersediaan infrastruktur mungkin sama penting dengan kedudukan dalam papan pendahulu penanda aras.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Pada 26 Ogos 2026, Z.ai mengesahkan bahawa pratonton percuma tanpa nama, Ox Alpha, ialah GLM 5.3 Flash—model 320 bilion parameter dengan 18 bilion parameter aktif setiap token dan lesen MIT.
Pada 26 Ogos 2026, Z.ai mengesahkan bahawa pratonton percuma tanpa nama, Ox Alpha, ialah GLM 5.3 Flash—model 320 bilion parameter dengan 18 bilion parameter aktif setiap token dan lesen MIT. Model ini menerima input teks, imej dan video, menawarkan konteks kira kira satu juta token, serta berharga AS$0.15 bagi setiap juta token input dan AS$0.50 bagi setiap juta token output pada kadar senarai Z.ai.
Pelancaran secara senyap membolehkan Z.ai menguji sistemnya dengan trafik ejen pengekodan dunia sebenar sebelum memperkenalkan nama rasmi dan mengeluarkan pemberat model untuk dimuat turun.