Ox Alpha merupakan GLM 5.3 Flash milik Zhipu AI, yang dikonfirmasi pada 26 Agustus 2026 setelah menjalani pratinjau buta gratis sejak 20 Agustus. GLM 5.3 Flash dirancang untuk pemrograman, pemrograman visual, pekerjaan dengan konteks panjang, dan agen berbasis alat.
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash adalah model di balik endpoint anonim Ox Alpha yang muncul di OpenRouter dan sejumlah alat pengembang pada 20 Agustus 2026. Zhipu AI—yang beroperasi secara internasional dengan nama Z.ai—mengidentifikasinya pada 26 Agustus, setelah menjadikan peluncuran tanpa merek itu sebagai uji lapangan untuk kemampuan pemrograman, multimodal, dan penggunaan agen. 3
4
Pengungkapan tersebut mengakhiri misteri selama hampir sepekan sekaligus memperkenalkan model open-weight berukuran besar: sistem mixture-of-experts (MoE) dengan total 320 miliar parameter, tetapi hanya 18 miliar parameter yang diaktifkan untuk setiap token. Model ini juga menawarkan konteks sekitar satu juta token, masukan multimodal native, serta bobot yang dirilis di bawah lisensi MIT. 3
6
8
Ox Alpha hadir tanpa kartu model, identitas pembuat, maupun lembar spesifikasi terperinci. Para pengembang menemukan endpoint gratis dengan konteks panjang dan dukungan masukan multimodal, lalu mengujinya dalam alur kerja pemrograman dan agen. Performa praktisnya menarik cukup banyak perhatian hingga memicu spekulasi tentang laboratorium yang berada di baliknya. 13
16
Menurut Zhipu, identitas model sengaja disamarkan. Dengan tidak mengungkap nama, spesifikasi, dan jumlah parameternya, perusahaan ingin para pengembang menilai sistem berdasarkan hasil, bukan reputasi merek, angka parameter, atau promosi peluncuran. Lalu lintas penggunaan tersebut memberi Zhipu pola pemakaian dan masukan dari beban kerja pengembangan perangkat lunak serta agen sebelum rilis resmi. 13
15
Sejumlah laporan menyebut kapasitas gratis sekitar 100 triliun token per hari selama pengujian. Patrick Collison, salah satu pendiri Stripe, termasuk pengembang terkemuka yang dilaporkan memuji kualitas model tersebut. Reaksi semacam ini ikut mengubah endpoint anonim itu menjadi peluncuran yang banyak dipantau, meski antusiasme publik tidak sama dengan evaluasi terkontrol. 13
14
Zhipu juga menyatakan bahwa layanan tersebut berjalan pada akselerator AI buatan dalam negeri China. South China Morning Post melaporkan bahwa uji coba itu menggunakan klaster berisi 100.000 chip dan model telah memproses 62 triliun token sebelum peluncuran resmi. Angka-angka ini berbeda dari laporan lain mengenai kapasitas dan penggunaan selama uji coba, sehingga sebaiknya dipahami sebagai angka yang dilaporkan perusahaan atau media, bukan hasil audit independen. 7
13
GLM-5.3-Flash merupakan model mixture-of-experts, atau MoE. Total kumpulan parameternya mencapai 320 miliar, tetapi hanya 18 miliar yang aktif pada setiap token. Secara praktis, pendekatan ini berupaya mempertahankan kapasitas representasi model berukuran sangat besar tanpa menerapkan seluruh parameter pada setiap langkah inferensi. 3
4
Model ini memiliki 45 lapisan dan disebut sebagai model pertama dalam seri GLM-5 yang mendukung multimodal secara native. GLM-5.3-Flash dirancang untuk memproses teks, gambar, video, dokumen visual, berkas, serta masukan multimodal yang disisipkan secara bergantian. Kemampuan ini berguna dalam alur kerja ketika agen harus mengamati antarmuka, memahami tangkapan layar, membaca dokumen, atau menilai hasil eksekusi kode—bukan hanya memproses teks. 4
11
Zhipu mengiklankan jendela konteks sebesar 1.048.576 token, yang umum dibulatkan menjadi satu juta token. Kapasitas ini ditujukan untuk repositori perangkat lunak berukuran besar, sesi agen yang panjang, kumpulan dokumen, serta pekerjaan yang menggabungkan kode dengan konteks visual atau berbasis berkas. 3
4
Model tersebut dilatih dari basis baru dengan arsitektur dan resep pelatihan yang dirancang ulang. Zhipu melaporkan penggunaan korpus multimodal berisi 30 triliun token. Karena itu, GLM-5.3-Flash diposisikan sebagai model baru yang berfokus pada efisiensi dan kemampuan multimodal, bukan sekadar versi GLM-5.3 yang diperkecil. 4
16
Model ini menggabungkan linear attention dan sparse attention. Linear attention ditujukan untuk membuat pemrosesan urutan jarak jauh lebih hemat, sedangkan sparse attention mempertahankan interaksi berfidelitas tinggi hanya pada bagian yang dianggap penting. Pendekatan tersebut dirancang untuk menyeimbangkan kemampuan konteks panjang dengan biaya inferensi yang lebih terkendali. 4
16
Zhipu juga menjelaskan mekanisme IndexPool untuk mengurangi beban memori dan latensi proses pengindeksan pada konteks yang sangat panjang. Arsitekturnya turut memakai manifold-constrained hyper-connections sebagai langkah efisiensi penskalaan. Nilai nyata teknik-teknik tingkat implementasi ini tetap bergantung pada konfigurasi layanan, panjang urutan, perangkat keras, dan jenis pekerjaan yang dijalankan. 4
16
Dibandingkan GLM-5.3, Zhipu mengklaim GLM-5.3-Flash mengurangi komputasi attention sebesar 3,01 kali dan penggunaan KV cache sebesar 4,44 kali, sambil mempertahankan kualitas konteks panjang. Klaim ini penting bagi pengembang karena komputasi attention dan memori KV cache dapat menjadi hambatan utama dalam agen yang berjalan lama. Namun, rasio tersebut terutama berasal dari materi teknis Zhipu sendiri dan tidak boleh dianggap sebagai peningkatan kecepatan universal yang telah diverifikasi secara independen. 4
GLM-5.3-Flash terutama ditujukan untuk pemrograman, pemrograman visual, tugas agen dengan rencana panjang, dan penggunaan alat. Kemampuan visual native-nya memungkinkan agen mengamati antarmuka, hasil rendering, dan umpan balik interaksi, sehingga tercipta siklus kerja antara kode, peramban, dan antarmuka grafis. 4
Hasil benchmark yang dilaporkan Zhipu mencakup:
Skor tersebut mendukung positioning GLM-5.3-Flash sebagai model untuk rekayasa perangkat lunak dan agen. Namun, perbandingan lintas-model perlu dilakukan dengan hati-hati. Benchmark agen dapat berubah cukup besar bergantung pada prompt, alat, scaffolding, perangkat keras, batas waktu, dan versi evaluasi. Angka-angka di atas paling tepat dibaca sebagai hasil yang dilaporkan Zhipu, bukan peringkat definitif terhadap semua model pesaing. 4
15
Zhipu merilis bobot GLM-5.3-Flash di Hugging Face dengan lisensi permisif MIT, termasuk rilis BF16. Dokumentasi model menyebut dukungan deployment melalui framework seperti SGLang dan vLLM. Ini memberi organisasi pilihan untuk menjalankan model secara lokal atau mengelolanya sendiri, alih-alih hanya mengandalkan API ter-host milik Z.ai. 3
6
8
Keterbukaan ini mengubah cara pengembang dapat mengevaluasi model. Mereka bisa mengujinya pada repositori, dokumen, antarmuka visual, dan lingkungan agen milik sendiri. Tim infrastruktur juga dapat menghitung biaya layanan serta kebutuhan perangkat keras secara langsung.
Meski begitu, total 320 miliar parameter tetap membuat deployment GLM-5.3-Flash menjadi pekerjaan teknis yang besar. Desain 18 miliar parameter aktif per token memang mengurangi beban komputasi, tetapi tidak otomatis membuat seluruh checkpoint menjadi ringan untuk dijalankan.
Eksperimen Ox Alpha bukan sekadar aksi publisitas. Uji coba tersebut mengukur apakah pengembang tetap akan menggunakan model ketika nama, jumlah parameter, dan afiliasi perusahaannya disembunyikan. Cara ini menghasilkan bentuk masukan produk yang menarik: pengguna nyata menyediakan beban kerja dan tanggapan sebelum pengungkapan resmi. 13
15
Namun, eksperimen itu juga memiliki keterbatasan. Akses gratis dapat menarik lalu lintas yang tidak biasa, pujian publik bisa dipengaruhi unsur kebaruan, dan pengujian anonim tidak mengontrol prompt atau membandingkan semua sistem dalam kondisi identik. Kesimpulan yang paling aman adalah bahwa GLM-5.3-Flash berhasil menarik minat besar dari pengembang sebelum identitasnya diketahui, lalu Zhipu menggunakan minat dan masukan tersebut untuk memvalidasi serta menyusun peluncuran resminya.
GLM-5.3-Flash adalah identitas resmi di balik Ox Alpha: model GLM open-weight dengan kemampuan multimodal native yang dibuat untuk pekerjaan pemrograman dan agen secara efisien. Spesifikasi utamanya mencakup desain MoE 320 miliar total dan 18 miliar parameter aktif, 45 lapisan, konteks satu juta token, attention hybrid linear dan sparse, serta bobot berlisensi MIT. 3
4
11
Daya tarik terbesar model ini bukan semata-mata skalanya. Yang lebih penting adalah kombinasi konteks panjang, masukan visual, penggunaan alat, dan klaim biaya layanan yang lebih rendah dalam model yang dapat diunduh dan dijalankan sendiri oleh pengembang. Peluncuran buta memberi Zhipu masukan pengguna yang relatif langsung, tetapi evaluasi independen dan dapat direproduksi masih diperlukan untuk mengukur bagaimana klaim arsitektur serta benchmark tersebut diterjemahkan ke performa produksi.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Ox Alpha merupakan GLM 5.3 Flash milik Zhipu AI, yang dikonfirmasi pada 26 Agustus 2026 setelah menjalani pratinjau buta gratis sejak 20 Agustus.
Ox Alpha merupakan GLM 5.3 Flash milik Zhipu AI, yang dikonfirmasi pada 26 Agustus 2026 setelah menjalani pratinjau buta gratis sejak 20 Agustus. GLM 5.3 Flash dirancang untuk pemrograman, pemrograman visual, pekerjaan dengan konteks panjang, dan agen berbasis alat.
Zhipu mengklaim desain perhatian linear dan sparse mengurangi komputasi attention 3,01 kali serta penggunaan KV cache 4,44 kali dibandingkan GLM 5.3.