Pada 26 Agustus 2026, Z.ai mengonfirmasi bahwa pratinjau anonim gratis bernama Ox Alpha adalah GLM 5.3 Flash—model Mixture of Experts dengan 320 miliar parameter total dan 18 miliar parameter aktif per token. GLM 5.3 Flash menerima input teks, gambar, dan video, mendukung konteks sekitar satu juta token, serta diril...
Diterbitkan olehDiedit dengan GPT-5.6 LunaGambar dibuat dengan GPT Image 1.5
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Pada 26 Agustus 2026, teka-teki tentang Ox Alpha akhirnya terjawab. Z.ai mengonfirmasi bahwa model anonim yang sebelumnya tersedia melalui OpenRouter dan OpenCode itu adalah GLM-5.3-Flash—model pertama dalam keluarga GLM-5 yang mendukung multimodalitas secara native. Model ini menawarkan bobot terbuka, konteks hingga sekitar satu juta token, serta fokus pada pemrograman dan tugas agen AI yang berjalan lama. 15
40
Namun, hal yang paling menarik bukan hanya identitas modelnya. Ox Alpha menggabungkan pratinjau gratis tanpa nama, penggunaan pengembang dalam skala besar, dan pengujian infrastruktur di kondisi nyata. Setelah mendapat perhatian komunitas, Z.ai mengungkap mereknya, merilis bobot model, dan mulai menerapkan tarif API.
GLM-5.3-Flash adalah model Mixture-of-Experts (MoE) dengan 320 miliar parameter total dan 18 miliar parameter aktif untuk setiap token. Model ini menerima input teks, gambar, dan video secara native, lalu menghasilkan keluaran berbentuk teks.
Kapasitas konteks yang ditargetkan berada di kisaran satu juta token. Angka yang tampil dapat berbeda menurut platform: dokumentasi Z.ai menyebut desain satu juta token, sedangkan OpenRouter mencantumkan jendela konteks sebesar 1.310.720 token. 1
2
3
40
Z.ai merilis bobotnya di bawah Lisensi MIT, sehingga model ini lebih mudah diunduh, dimodifikasi, dan dijalankan sendiri dibandingkan layanan AI yang hanya tersedia melalui API tertutup. Setelah fase anonim berakhir, model tersebut juga muncul dengan nama resminya di OpenRouter. 3
4
8
GLM-5.3-Flash juga tidak boleh disamakan dengan produk GLM-5.3 berukuran lebih besar yang diumumkan sebelumnya pada Agustus. Keduanya merupakan SKU berbeda: GLM-5.3-Flash adalah model 320B-A18B yang dirancang dengan biaya layanan lebih rendah, bukan versi yang sama dari lini GLM-5.3 yang lebih besar. 10
Z.ai menyatakan GLM-5.3-Flash menawarkan peningkatan dibandingkan GLM-5.2 dengan biaya penyajian yang lebih rendah. Dalam hasil yang dikutip saat peluncuran, model ini meraih skor 63,4 pada DeepSWE v1.1, dibandingkan 46,2 untuk GLM-5.2. Z.ai juga melaporkan skor 29,0 pada tolok ukur coding internal, mendekati 29,5 yang dilaporkan untuk Claude Opus 4.8. 3
16
Angka-angka tersebut berguna untuk memahami posisi yang ingin dibangun Z.ai, tetapi belum menjadi konfirmasi independen bahwa model ini setara dengan model Anthropic. Definisi benchmark, konfigurasi evaluasi, teknik prompting, dan kemampuan pihak lain untuk mereproduksi hasil tetap penting.
Kesimpulan paling aman adalah bahwa Z.ai mengklaim performa coding dan agent yang kuat dengan biaya jauh lebih rendah—bukan bahwa GLM-5.3-Flash sudah terbukti mengungguli seluruh model frontier tertutup.
Daya tarik terbesar Ox Alpha selama masa pratinjau adalah akses gratis bagi pengembang. Fase tersebut berakhir ketika model mendapatkan identitas resminya. Harga daftar yang dilaporkan Z.ai adalah $0,15 per juta token input dan $0,50 per juta token output. 1
3
Di sekitar waktu peluncuran, OpenRouter menampilkan tarif promosi yang lebih rendah, yakni $0,075 per juta token input dan $0,25 per juta token output. 2 Perbedaan ini penting: akses gratis saat pratinjau, harga daftar Z.ai, dan diskon peluncuran khusus platform adalah tiga kondisi akses yang berbeda.
Bahkan pada harga daftar, aspek ekonomi menjadi bagian utama dari daya tarik model ini. Coding agent dapat mengonsumsi konteks dan menghasilkan output dalam jumlah besar. Karena itu, biaya token yang rendah bisa memengaruhi pilihan model sama kuatnya dengan keunggulan kecil dalam skor benchmark.
Z.ai menyatakan GLM-5.3-Flash berjalan sepenuhnya pada akselerator AI buatan China. 15 Laporan mengenai sistem penyajiannya menyebut adanya stack yang dikustomisasi berbasis SGLang, dengan teknik seperti kuantisasi, tensor parallelism, format cache campuran, pemisahan layer, serta arsitektur encode–prefill–decode yang dipisahkan.
Tujuannya adalah meningkatkan kinerja penyajian dari ujung ke ujung sambil menyesuaikan diri dengan keterbatasan perangkat keras domestik. 25
Hal ini memperluas narasi Z.ai sebelumnya mengenai keluarga GLM. Perusahaan tersebut menyatakan bahwa keluarga GLM-5 dilatih menggunakan prosesor Huawei Ascend tanpa perangkat keras Nvidia. Laporan lain juga mencatat bahwa status Z.ai dalam U.S. Entity List membatasi aksesnya terhadap akselerator Nvidia H100, H200, dan B200. 26
Klaim soal infrastruktur ini penting secara strategis, tetapi sebaiknya dipahami sebagai pernyataan perusahaan dan laporan industri, bukan perbandingan performa perangkat keras yang telah diaudit sepenuhnya. Kesimpulan yang lebih kuat adalah bahwa Z.ai sedang menunjukkan kemampuannya melayani model multimodal besar tanpa bergantung pada GPU pusat data Nvidia yang paling canggih.
Rilis anonim tersebut tampaknya mengikuti pola yang bisa disebut sebagai strategi peluncuran diam-diam: menerbitkan model yang mumpuni tanpa mencantumkan identitas, memberikannya secara gratis melalui jalur coding yang populer, mengamati cara pengembang menggunakannya, lalu mengungkap produk setelah memperoleh masukan dari penggunaan nyata.
Z.ai sebelumnya juga dikaitkan dengan pengujian bernama “Pony Alpha” yang memakai gagasan serupa. Dalam kasus Ox Alpha, anggota komunitas mencoba mengidentifikasi pembuatnya melalui perilaku tokenizer, petunjuk pemrosesan video, dan pola kesalahan API. 7
11
13
Sejumlah laporan saat peluncuran turut menyebut angka penggunaan yang sangat besar dan antusiasme pengembang, termasuk klaim lebih dari 503.000 pengguna OpenCode dan 44 triliun token yang diproses. Namun, angka serta kutipan tersebut belum dapat diverifikasi secara independen dari sumber primer yang tersedia. Karena itu, informasi tersebut lebih tepat dibaca sebagai klaim pada periode peluncuran, bukan data adopsi yang telah diaudit. 14
Dengan pendekatan ini, satu peluncuran menjalankan dua fungsi sekaligus: menjadi uji beban produksi untuk sistem penyajian Z.ai dan menjadi kampanye pemasaran yang membangun rasa penasaran komunitas.
GLM-5.3-Flash belum membuktikan bahwa Z.ai telah mengungguli OpenAI atau Anthropic dalam seluruh kemampuan model frontier. Namun, rilis ini menunjukkan kombinasi yang cukup mengganggu peta persaingan: input multimodal, konteks sangat panjang, bobot terbuka berlisensi MIT, fokus pada coding agent, dan harga API yang rendah. 15
40
Bagi pengembang, kombinasi tersebut dapat menurunkan biaya berpindah model dan membuat penerapan multi-provider atau self-hosting lebih realistis. Bagi penyedia model tertutup, kehadiran model seperti ini menambah tekanan terhadap harga dan margin—terutama dalam beban kerja coding, ketika volume token, latensi, kendali deployment, dan ketersediaan infrastruktur bisa sama pentingnya dengan posisi di papan peringkat benchmark.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Pada 26 Agustus 2026, Z.ai mengonfirmasi bahwa pratinjau anonim gratis bernama Ox Alpha adalah GLM 5.3 Flash—model Mixture of Experts dengan 320 miliar parameter total dan 18 miliar parameter aktif per token.
Pada 26 Agustus 2026, Z.ai mengonfirmasi bahwa pratinjau anonim gratis bernama Ox Alpha adalah GLM 5.3 Flash—model Mixture of Experts dengan 320 miliar parameter total dan 18 miliar parameter aktif per token. GLM 5.3 Flash menerima input teks, gambar, dan video, mendukung konteks sekitar satu juta token, serta dirilis dengan bobot berlisensi MIT.
Harga resmi Z.ai tercatat sebesar $0,15 per juta token input dan $0,50 per juta token output, sementara OpenRouter menampilkan tarif promosi yang lebih rendah.
Pada 26 Agustus 2026, Z.ai mengonfirmasi bahwa pratinjau anonim gratis bernama Ox Alpha adalah GLM 5.3 Flash—model Mixture of Experts dengan 320 miliar parameter total dan 18 miliar parameter aktif per token. GLM 5.3 Flash menerima input teks, gambar, dan video, mendukung konteks sekitar satu juta token, serta diril...
Diterbitkan olehDiedit dengan GPT-5.6 LunaGambar dibuat dengan GPT Image 1.5
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Pada 26 Agustus 2026, teka-teki tentang Ox Alpha akhirnya terjawab. Z.ai mengonfirmasi bahwa model anonim yang sebelumnya tersedia melalui OpenRouter dan OpenCode itu adalah GLM-5.3-Flash—model pertama dalam keluarga GLM-5 yang mendukung multimodalitas secara native. Model ini menawarkan bobot terbuka, konteks hingga sekitar satu juta token, serta fokus pada pemrograman dan tugas agen AI yang berjalan lama. 15
40
Namun, hal yang paling menarik bukan hanya identitas modelnya. Ox Alpha menggabungkan pratinjau gratis tanpa nama, penggunaan pengembang dalam skala besar, dan pengujian infrastruktur di kondisi nyata. Setelah mendapat perhatian komunitas, Z.ai mengungkap mereknya, merilis bobot model, dan mulai menerapkan tarif API.
GLM-5.3-Flash adalah model Mixture-of-Experts (MoE) dengan 320 miliar parameter total dan 18 miliar parameter aktif untuk setiap token. Model ini menerima input teks, gambar, dan video secara native, lalu menghasilkan keluaran berbentuk teks.
Kapasitas konteks yang ditargetkan berada di kisaran satu juta token. Angka yang tampil dapat berbeda menurut platform: dokumentasi Z.ai menyebut desain satu juta token, sedangkan OpenRouter mencantumkan jendela konteks sebesar 1.310.720 token. 1
2
3
40
Z.ai merilis bobotnya di bawah Lisensi MIT, sehingga model ini lebih mudah diunduh, dimodifikasi, dan dijalankan sendiri dibandingkan layanan AI yang hanya tersedia melalui API tertutup. Setelah fase anonim berakhir, model tersebut juga muncul dengan nama resminya di OpenRouter. 3
4
8
GLM-5.3-Flash juga tidak boleh disamakan dengan produk GLM-5.3 berukuran lebih besar yang diumumkan sebelumnya pada Agustus. Keduanya merupakan SKU berbeda: GLM-5.3-Flash adalah model 320B-A18B yang dirancang dengan biaya layanan lebih rendah, bukan versi yang sama dari lini GLM-5.3 yang lebih besar. 10
Z.ai menyatakan GLM-5.3-Flash menawarkan peningkatan dibandingkan GLM-5.2 dengan biaya penyajian yang lebih rendah. Dalam hasil yang dikutip saat peluncuran, model ini meraih skor 63,4 pada DeepSWE v1.1, dibandingkan 46,2 untuk GLM-5.2. Z.ai juga melaporkan skor 29,0 pada tolok ukur coding internal, mendekati 29,5 yang dilaporkan untuk Claude Opus 4.8. 3
16
Angka-angka tersebut berguna untuk memahami posisi yang ingin dibangun Z.ai, tetapi belum menjadi konfirmasi independen bahwa model ini setara dengan model Anthropic. Definisi benchmark, konfigurasi evaluasi, teknik prompting, dan kemampuan pihak lain untuk mereproduksi hasil tetap penting.
Kesimpulan paling aman adalah bahwa Z.ai mengklaim performa coding dan agent yang kuat dengan biaya jauh lebih rendah—bukan bahwa GLM-5.3-Flash sudah terbukti mengungguli seluruh model frontier tertutup.
Daya tarik terbesar Ox Alpha selama masa pratinjau adalah akses gratis bagi pengembang. Fase tersebut berakhir ketika model mendapatkan identitas resminya. Harga daftar yang dilaporkan Z.ai adalah $0,15 per juta token input dan $0,50 per juta token output. 1
3
Di sekitar waktu peluncuran, OpenRouter menampilkan tarif promosi yang lebih rendah, yakni $0,075 per juta token input dan $0,25 per juta token output. 2 Perbedaan ini penting: akses gratis saat pratinjau, harga daftar Z.ai, dan diskon peluncuran khusus platform adalah tiga kondisi akses yang berbeda.
Bahkan pada harga daftar, aspek ekonomi menjadi bagian utama dari daya tarik model ini. Coding agent dapat mengonsumsi konteks dan menghasilkan output dalam jumlah besar. Karena itu, biaya token yang rendah bisa memengaruhi pilihan model sama kuatnya dengan keunggulan kecil dalam skor benchmark.
Z.ai menyatakan GLM-5.3-Flash berjalan sepenuhnya pada akselerator AI buatan China. 15 Laporan mengenai sistem penyajiannya menyebut adanya stack yang dikustomisasi berbasis SGLang, dengan teknik seperti kuantisasi, tensor parallelism, format cache campuran, pemisahan layer, serta arsitektur encode–prefill–decode yang dipisahkan.
Tujuannya adalah meningkatkan kinerja penyajian dari ujung ke ujung sambil menyesuaikan diri dengan keterbatasan perangkat keras domestik. 25
Hal ini memperluas narasi Z.ai sebelumnya mengenai keluarga GLM. Perusahaan tersebut menyatakan bahwa keluarga GLM-5 dilatih menggunakan prosesor Huawei Ascend tanpa perangkat keras Nvidia. Laporan lain juga mencatat bahwa status Z.ai dalam U.S. Entity List membatasi aksesnya terhadap akselerator Nvidia H100, H200, dan B200. 26
Klaim soal infrastruktur ini penting secara strategis, tetapi sebaiknya dipahami sebagai pernyataan perusahaan dan laporan industri, bukan perbandingan performa perangkat keras yang telah diaudit sepenuhnya. Kesimpulan yang lebih kuat adalah bahwa Z.ai sedang menunjukkan kemampuannya melayani model multimodal besar tanpa bergantung pada GPU pusat data Nvidia yang paling canggih.
Rilis anonim tersebut tampaknya mengikuti pola yang bisa disebut sebagai strategi peluncuran diam-diam: menerbitkan model yang mumpuni tanpa mencantumkan identitas, memberikannya secara gratis melalui jalur coding yang populer, mengamati cara pengembang menggunakannya, lalu mengungkap produk setelah memperoleh masukan dari penggunaan nyata.
Z.ai sebelumnya juga dikaitkan dengan pengujian bernama “Pony Alpha” yang memakai gagasan serupa. Dalam kasus Ox Alpha, anggota komunitas mencoba mengidentifikasi pembuatnya melalui perilaku tokenizer, petunjuk pemrosesan video, dan pola kesalahan API. 7
11
13
Sejumlah laporan saat peluncuran turut menyebut angka penggunaan yang sangat besar dan antusiasme pengembang, termasuk klaim lebih dari 503.000 pengguna OpenCode dan 44 triliun token yang diproses. Namun, angka serta kutipan tersebut belum dapat diverifikasi secara independen dari sumber primer yang tersedia. Karena itu, informasi tersebut lebih tepat dibaca sebagai klaim pada periode peluncuran, bukan data adopsi yang telah diaudit. 14
Dengan pendekatan ini, satu peluncuran menjalankan dua fungsi sekaligus: menjadi uji beban produksi untuk sistem penyajian Z.ai dan menjadi kampanye pemasaran yang membangun rasa penasaran komunitas.
GLM-5.3-Flash belum membuktikan bahwa Z.ai telah mengungguli OpenAI atau Anthropic dalam seluruh kemampuan model frontier. Namun, rilis ini menunjukkan kombinasi yang cukup mengganggu peta persaingan: input multimodal, konteks sangat panjang, bobot terbuka berlisensi MIT, fokus pada coding agent, dan harga API yang rendah. 15
40
Bagi pengembang, kombinasi tersebut dapat menurunkan biaya berpindah model dan membuat penerapan multi-provider atau self-hosting lebih realistis. Bagi penyedia model tertutup, kehadiran model seperti ini menambah tekanan terhadap harga dan margin—terutama dalam beban kerja coding, ketika volume token, latensi, kendali deployment, dan ketersediaan infrastruktur bisa sama pentingnya dengan posisi di papan peringkat benchmark.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Pada 26 Agustus 2026, Z.ai mengonfirmasi bahwa pratinjau anonim gratis bernama Ox Alpha adalah GLM 5.3 Flash—model Mixture of Experts dengan 320 miliar parameter total dan 18 miliar parameter aktif per token.
Pada 26 Agustus 2026, Z.ai mengonfirmasi bahwa pratinjau anonim gratis bernama Ox Alpha adalah GLM 5.3 Flash—model Mixture of Experts dengan 320 miliar parameter total dan 18 miliar parameter aktif per token. GLM 5.3 Flash menerima input teks, gambar, dan video, mendukung konteks sekitar satu juta token, serta dirilis dengan bobot berlisensi MIT.
Harga resmi Z.ai tercatat sebesar $0,15 per juta token input dan $0,50 per juta token output, sementara OpenRouter menampilkan tarif promosi yang lebih rendah.