Dirilis pada 26 Agustus 2026, Qwen3.8 Flash Next adalah model open weight multimodal dari Qwen yang berfungsi sebagai pratinjau teknis arsitektur Qwen4. Model ini memiliki 125 miliar parameter utama serta 51 miliar parameter embedding N gram, tetapi hanya mengaktifkan sekitar 6 miliar parameter per token.
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba melalui tim Qwen merilis Qwen3.8-Flash-Next pada 26 Agustus 2026, dengan pemberitaan lanjutan muncul pada 27 Agustus. Model dengan bobot terbuka ini bukan flagship Qwen4 final, melainkan pratinjau awal yang dapat diperiksa publik atas arsitektur yang menurut Qwen akan menjadi fondasi keluarga Qwen4. 1
2
15
Gagasan utamanya cukup tidak biasa: jaringan utama memiliki 125 miliar parameter, ditambah komponen embedding N-gram sebesar 51 miliar parameter, tetapi hanya sekitar 6 miliar parameter yang aktif untuk setiap token. Kombinasi ini dirancang untuk mempertahankan kapasitas model besar tanpa menanggung biaya komputasi penuh seperti pada model dense di setiap token. 4
15
Nama Qwen3.8-Flash-Next merujuk pada model terbuka yang dirilis Qwen. Sementara itu, nama Qwen3.8-Flash digunakan untuk model dan layanan API berorientasi produksi. Jadi, Qwen3.8-Flash-Next lebih tepat dipahami sebagai pratinjau arsitektur terbuka untuk pengembang, bukan peluncuran lengkap keluarga Qwen4. Pemberitaan menggambarkannya sebagai sistem multimodal berbasis mixture-of-experts (MoE) yang dibangun dengan teknologi yang direncanakan untuk Qwen4. 1
2
15
Perbedaan ini penting. Qwen3.8-Flash-Next adalah cetak biru teknis yang bisa diuji dan dikembangkan, bukan bukti bahwa seluruh lini Qwen4 sudah resmi hadir. Dengan membuka bobotnya lebih awal, Qwen memberi kesempatan kepada peneliti dan pengembang untuk memeriksa desain, menyiapkan dukungan perangkat lunak, serta memberikan masukan sebelum keluarga model yang lebih luas dirilis. 2
3
15
Angka 1 juta token tidak boleh disamakan dengan batas konteks native. Konfigurasi standar model menetapkan 262.144 token; jendela yang lebih besar bergantung pada ekstensi YaRN dan sebaiknya diperlakukan sebagai konfigurasi tambahan yang perlu diuji secara terpisah. 1
4
16
Qwen3.8-Flash-Next menggabungkan Gated DeltaNet (GDN) dengan Qwen Sparse Attention (QSA). GDN dirancang untuk memadatkan informasi dari konteks sebelumnya, sedangkan QSA menggunakan indeks ringan untuk menemukan dan memilih mikroblok yang relevan, alih-alih menerapkan mekanisme perhatian penuh secara merata pada seluruh riwayat. 4
Tujuannya adalah mengurangi biaya dan perlambatan inferensi ketika panjang urutan terus bertambah. Qwen melaporkan prefill hingga 7,6 kali lebih cepat dan decoding hingga 4,9 kali lebih cepat pada urutan sepanjang 1 juta token. Angka tersebut merupakan klaim yang dilaporkan vendor dan bergantung pada perangkat keras, implementasi, karakteristik urutan, serta konfigurasi benchmark. Karena itu, angka tersebut belum tentu berlaku pada setiap penerapan. 4
Komponen embedding N-gram yang terpisah memberi sistem kapasitas representasi tambahan, sambil membatasi jumlah parameter yang harus diproses secara aktif untuk setiap token. Desain Qwen juga mendukung pemindahan tabel embedding ke memori host dan prefetching asinkron, sehingga transfer data dapat berjalan bersamaan dengan komputasi model. 4
Bagi pengelola infrastruktur AI, arah ini penting secara praktis. Penempatan memori dan perpindahan data bisa sama menentukan dengan jumlah parameter mentah, terutama untuk beban kerja yang melibatkan dokumen panjang atau pemrosesan batch berskala besar.
Pratinjau ini tidak hanya menawarkan blok perhatian baru. Qwen melaporkan penggunaan optimizer Muon, penyesuaian interaksinya dengan AdamW dan pengelolaan parameter, serta hukum penskalaan baru yang disesuaikan dengan desain model tersebut. 4
Dengan demikian, rilis ini menjadi uji publik atas resep yang lebih luas: membangun model dengan kapasitas total besar, tetapi komputasi aktif yang relatif rendah.
Qwen menyatakan bahwa pelatihan Qwen3.8-Flash membutuhkan biaya sekitar sepersembilan biaya Qwen3.7-Plus, sekaligus meningkatkan performa pada tugas pemrograman dan pekerjaan kantor. Reuters juga melaporkan klaim perusahaan bahwa model tersebut menawarkan hasil yang lebih kuat pada tugas coding dan pekerjaan kantor dengan biaya pelatihan lebih rendah. 1
4
Materi rilis mencantumkan skor 58,7 pada DeepSWE 1.1, 62,5 pada SWE-bench Pro, dan 84,5 pada AndroidWorld. Qwen menempatkan hasil tersebut di atas DeepSeek V4 Flash dalam segmen model bernilai ekonomis. Namun, perbandingan itu berasal dari laporan perusahaan; materi yang tersedia belum membuktikan bahwa hasilnya telah direplikasi secara independen dalam kondisi evaluasi yang setara. 4
Harga API yang disebutkan untuk layanan produksi Qwen3.8-Flash adalah 1 yuan per 1 juta token input dan 3 yuan per 1 juta token output, tanpa perbedaan tarif jam sibuk dan di luar jam sibuk dalam materi rilis. Perbandingan harga dengan model lain tetap bergantung pada beban kerja karena versi model, caching, panjang konteks, tingkat layanan, dan kebutuhan output dapat berbeda. 1
4
Bobot terbuka membuat Qwen3.8-Flash-Next berguna sebagai platform eksperimen sebelum Qwen4 hadir. Pengembang dapat mulai menyesuaikan alat inferensi, menguji kuantisasi dan metode penyajian model, serta melihat perilakunya pada beban kerja sendiri tanpa harus menunggu implementasi Qwen4 final. 2
3
15
Desainnya terutama relevan untuk pekerjaan yang dibatasi panjang konteks atau biaya token, seperti:
Daftar tersebut merupakan penggunaan yang masuk akal berdasarkan desain konteks panjang dan jumlah parameter aktif model, bukan jaminan bahwa Qwen3.8-Flash-Next akan mengungguli setiap alternatif dense atau model dengan perhatian penuh dalam produksi. Kebutuhan perangkat keras, perangkat lunak penyajian, kualitas kuantisasi, strategi retrieval, dan komposisi beban kerja akan menentukan biaya sebenarnya.
Qwen3.8-Flash-Next penting karena membuka arah arsitektur kepada publik lebih awal. Model ini menyediakan cara konkret untuk menguji apakah perhatian sparse dan terkompresi, embedding tambahan berukuran besar, serta jumlah parameter aktif yang rendah dapat menghasilkan pemrosesan konteks panjang yang lebih ekonomis tanpa mengorbankan kualitas secara berlebihan.
Namun, angka-angka paling menonjol dalam rilis—termasuk peningkatan kecepatan, keunggulan benchmark, pengurangan biaya pelatihan, dan klaim nilai kompetitif—sebagian besar berasal dari Qwen atau pemberitaan berdasarkan pengungkapan Qwen. Pengujian independen masih diperlukan pada beragam perangkat keras, bahasa, panjang konteks, tugas multimodal, dan alur kerja agen di lingkungan produksi.
Kesimpulan yang paling aman bukanlah bahwa “Qwen3.8-Flash-Next mengalahkan semua model pesaing”. Kesimpulan yang lebih kuat secara bukti adalah bahwa model ini merupakan pratinjau teknis multimodal MoE terbuka yang memberi komunitas pengembang gambaran sangat awal tentang arsitektur sistem yang sedang disiapkan Alibaba untuk Qwen4—sekaligus cetak biru yang dapat diuji untuk membuat AI dengan konteks sangat panjang menjadi lebih efisien.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Dirilis pada 26 Agustus 2026, Qwen3.8 Flash Next adalah model open weight multimodal dari Qwen yang berfungsi sebagai pratinjau teknis arsitektur Qwen4.
Dirilis pada 26 Agustus 2026, Qwen3.8 Flash Next adalah model open weight multimodal dari Qwen yang berfungsi sebagai pratinjau teknis arsitektur Qwen4. Model ini memiliki 125 miliar parameter utama serta 51 miliar parameter embedding N gram, tetapi hanya mengaktifkan sekitar 6 miliar parameter per token.
Desain Gated DeltaNet–Qwen Sparse Attention dan konteks native 262.144 token ditujukan untuk membuat pemrosesan dokumen serta percakapan yang sangat panjang lebih efisien.