Dilancarkan pada 26 Ogos 2026, Qwen3.8 Flash Next ialah model multimodal Mixture of Experts berwajaran terbuka yang menjadi pratonton teknikal seni bina Qwen4. Model ini mempunyai 125 bilion parameter utama serta 51 bilion parameter tambahan untuk embeddings N gram, tetapi hanya mengaktifkan kira kira 6 bilion param...
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba melalui pasukan Qwen melancarkan Qwen3.8-Flash-Next pada 26 Ogos 2026, dengan liputan susulan pada 27 Ogos. Model berwajaran terbuka ini bukanlah model utama Qwen4 yang telah dilancarkan, sebaliknya pratonton awal yang boleh diperiksa oleh penyelidik dan pembangun terhadap seni bina yang menurut Qwen akan menjadi asas keluarga Qwen4. 1
2
15
Perkara paling menarik ialah gabungan saiz keseluruhan yang besar dengan jumlah pengiraan aktif yang kecil: model ini mempunyai 125 bilion parameter utama, ditambah 51 bilion parameter embeddings N-gram, tetapi hanya mengaktifkan kira-kira 6 bilion parameter bagi setiap token. Pendekatan ini cuba mengekalkan kapasiti model tanpa menanggung kos pengiraan model padat sepenuhnya untuk setiap token. 4
15
Nama Qwen3.8-Flash-Next merujuk kepada model sumber terbuka yang dikeluarkan oleh Qwen. Nama Qwen3.8-Flash pula digunakan untuk versi berorientasikan pengeluaran dan tawaran API. Ringkasnya, versi “Next” ialah pratonton seni bina untuk pembangun, manakala “Flash” ialah model yang disediakan untuk penggunaan perkhidmatan. 1
2
15
Model ini dibina sebagai sistem multimodal Mixture-of-Experts (MoE), iaitu model yang mempunyai banyak “pakar” tetapi hanya mengaktifkan bahagian tertentu apabila memproses setiap token. Qwen menggambarkannya sebagai pratonton awal teknologi yang dirancang untuk Qwen4, bukannya bukti bahawa seluruh keluarga Qwen4 sudah tersedia. 2
3
15
Penerbitan pemberat model secara terbuka memberi peluang kepada komuniti untuk menguji seni bina tersebut, membina sokongan perisian, mencuba kaedah kuantisasi dan memberikan maklum balas sebelum keluaran Qwen4 yang lebih luas.
Angka 1 juta token perlu difahami dengan tepat. Had konteks asli dalam konfigurasi standard ialah 262,144 token. Sokongan sehingga 1 juta token bergantung pada peluasan YaRN, jadi ia bukan had asli model dan prestasinya wajar dinilai sebagai konfigurasi lanjutan. 1
4
16
Qwen3.8-Flash-Next menggabungkan Gated DeltaNet (GDN) dengan Qwen Sparse Attention (QSA). GDN direka untuk memampatkan maklumat daripada konteks terdahulu, manakala QSA menggunakan pengindeks ringan untuk mengenal pasti dan memilih blok mikro yang berkaitan. Dengan itu, model tidak perlu menggunakan perhatian penuh secara seragam terhadap keseluruhan sejarah input. 4
Matlamatnya ialah mengurangkan kos dan kelewatan apabila jumlah token meningkat. Qwen melaporkan sehingga 7.6 kali lebih pantas ketika prefill dan 4.9 kali lebih pantas ketika decoding pada jujukan sepanjang 1 juta token. Namun, angka ini datang daripada laporan vendor dan bergantung pada perkakasan, pelaksanaan, panjang jujukan serta tetapan penanda aras. Ia tidak sepatutnya dianggap sebagai keputusan sejagat untuk semua deployment. 4
Komponen embeddings N-gram yang berasingan memberikan kapasiti perwakilan tambahan, sambil mengehadkan jumlah parameter yang perlu diproses secara aktif bagi setiap token. Qwen turut menyokong pemindahan jadual embeddings ini ke memori hos dan melakukan prefetch secara tidak segerak, supaya pemindahan data boleh berlaku serentak dengan pengiraan model. 4
Bagi pengendali infrastruktur AI, ini merupakan hala tuju yang penting. Lokasi memori dan pergerakan data kadangkala sama pentingnya dengan jumlah parameter, khususnya apabila sistem perlu memproses dokumen panjang atau tugasan kelompok pada skala tinggi.
Pratonton ini bukan sekadar checkpoint dengan blok perhatian yang berbeza. Qwen melaporkan penggunaan pengoptimum Muon, penyesuaian terhadap cara Muon berinteraksi dengan AdamW dan pengendalian parameter, serta satu hukum penskalaan baharu yang dipadankan dengan seni bina tersebut. 4
Gabungan perubahan ini menguji satu resipi yang lebih luas: membina model dengan kapasiti keseluruhan yang besar tetapi pengiraan aktif yang relatif rendah.
Qwen berkata latihan Qwen3.8-Flash memerlukan kira-kira sembilan kali lebih rendah kos berbanding Qwen3.7-Plus, sambil meningkatkan prestasi dalam pengekodan dan tugasan pejabat. Reuters turut melaporkan dakwaan syarikat bahawa model itu menawarkan keputusan lebih baik untuk tugasan tersebut dengan kos latihan yang lebih rendah. 1
4
Laporan keluaran menyebut skor 58.7 dalam DeepSWE 1.1, 62.5 dalam SWE-bench Pro dan 84.5 dalam AndroidWorld. Qwen meletakkan keputusan ini mengatasi DeepSeek V4 Flash dalam segmen nilai. Bagaimanapun, perbandingan tersebut ialah dakwaan syarikat; bahan yang tersedia belum membuktikan bahawa keputusan itu telah diulang secara bebas dalam keadaan penilaian yang benar-benar setara. 4
Bagi tawaran API produksi Qwen3.8-Flash, harga yang dinyatakan ialah 1 yuan bagi setiap juta token input dan 3 yuan bagi setiap juta token output. Bahan keluaran tidak menyatakan perbezaan harga waktu puncak dan luar puncak. Perbandingan dengan model lain tetap bergantung pada versi model, penggunaan cache, panjang konteks, tahap perkhidmatan dan keperluan output. 1
4
Pemberat terbuka menjadikan Qwen3.8-Flash-Next sebuah platform percubaan sebelum Qwen4 tiba. Pembangun boleh mula menyesuaikan alat inferens, menguji kuantisasi dan kaedah penyajian, serta melihat prestasinya pada beban kerja sebenar mereka tanpa perlu menunggu pelaksanaan Qwen4 yang muktamad. 2
3
15
Reka bentuknya amat relevan untuk tugasan yang terhad oleh panjang konteks atau kos token, termasuk:
Namun, ini ialah kegunaan yang dicadangkan oleh reka bentuk model, bukannya jaminan bahawa ia akan mengatasi setiap model padat atau sistem perhatian penuh dalam pengeluaran. Keperluan perkakasan, perisian penyajian, kualiti kuantisasi, strategi mendapatkan semula maklumat dan jenis beban kerja akan menentukan kos sebenar.
Kepentingan Qwen3.8-Flash-Next terletak pada keterbukaan arah seni binanya. Komuniti pembangun kini boleh menguji sama ada perhatian jarang dan termampat, embeddings tambahan berskala besar serta jumlah parameter aktif yang rendah mampu memberikan pemprosesan konteks panjang yang lebih menjimatkan tanpa mengorbankan kualiti secara ketara.
Pada masa yang sama, angka paling menonjol—termasuk peningkatan kelajuan, kedudukan penanda aras, pengurangan kos latihan dan dakwaan nilai—sebahagian besarnya datang daripada Qwen atau laporan berdasarkan pendedahan Qwen. Ujian bebas masih diperlukan merentasi perkakasan, bahasa, panjang konteks, tugasan multimodal dan aliran kerja ejen dalam pengeluaran.
Kesimpulan yang paling berhati-hati bukanlah bahawa “Qwen3.8-Flash-Next mengatasi semua model pesaing”. Lebih tepat, ia ialah pratonton teknikal MoE multimodal yang terbuka dan memberi komuniti pembangun gambaran awal tentang seni bina sistem yang sedang disediakan Alibaba untuk Qwen4—serta pelan tindakan yang boleh diuji untuk menjadikan AI berkonteks sangat panjang lebih cekap.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Dilancarkan pada 26 Ogos 2026, Qwen3.8 Flash Next ialah model multimodal Mixture of Experts berwajaran terbuka yang menjadi pratonton teknikal seni bina Qwen4.
Dilancarkan pada 26 Ogos 2026, Qwen3.8 Flash Next ialah model multimodal Mixture of Experts berwajaran terbuka yang menjadi pratonton teknikal seni bina Qwen4. Model ini mempunyai 125 bilion parameter utama serta 51 bilion parameter tambahan untuk embeddings N gram, tetapi hanya mengaktifkan kira kira 6 bilion parameter bagi setiap token.
Ia menyokong konteks asli 262,144 token, boleh dipanjangkan kepada 1 juta token melalui YaRN, dan direka untuk menjadikan pemprosesan dokumen serta tugasan AI berskala besar lebih cekap.