Alibaba memasangkan Qwen3.8 Flash, model multimodal berasaskan awan pada harga $0.16 bagi sejuta token input dan $0.47 bagi sejuta token output, dengan Flash Next, pratonton seni bina Qwen4 yang mempunyai pemberat ter... Flash Next menggabungkan model utama 125 bilion parameter dengan 51 bilion parameter pembenaman...
Research answer

Create a landscape editorial hero image for this Studio Global article: What did Alibaba announce with the release of the multimodal Qwen3.8-Flash and the open-weight Qwen3.8-Flash-Next prototype for its future Q. Article summary: Alibaba is pairing a low-cost production model with an open-weight architectural preview: it is trying to make Qwen a widely deployed cloud service while seeding the developer ecosystem for the forthcoming Qwen4 generati. Topic tags: general, documentation, general web, user generated, news. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, water
Alibaba sedang menggabungkan dua produk Qwen yang mempunyai peranan berbeza tetapi saling melengkapi. Qwen3.8-Flash ialah model multimodal untuk penggunaan produksi, ditawarkan melalui QwenCloud pada kadar token yang sangat rendah. Qwen3.8-Flash-Next pula ialah model dengan pemberat terbuka yang berfungsi sebagai pratonton seni bina yang menurut Alibaba akan menjadi asas kepada keluarga Qwen4. 515
Strateginya agak jelas: harga API yang rendah digunakan untuk menarik beban kerja perusahaan ke infrastruktur awan Alibaba, manakala pemberat terbuka membantu membina penerimaan pembangun, alatan dan pengetahuan ekosistem sebelum Qwen4 tiba. Namun, tuntutan prestasi dan penjimatan kos yang paling menonjol masih banyak bergantung pada kenyataan Alibaba serta kad modelnya, bukannya ujian bebas.
Alibaba menerangkan Qwen3.8-Flash sebagai model multimodal mixture-of-experts (MoE) yang direka untuk pengekodan, kerja pejabat dan tugasan dengan konteks panjang. Saiz tetingkap konteks lalainya ialah 262,144 token, dan ia boleh diperluas sehingga 1 juta token untuk fail besar, perbualan panjang serta aliran kerja penyelidikan. 515
Harga yang diumumkan untuk QwenCloud ialah $0.16 bagi setiap sejuta token input dan $0.47 bagi setiap sejuta token output. Alibaba pada awalnya berkata API produksi itu akan tersedia tidak lama lagi, manakala laporan berikutnya menyatakan QwenCloud menyediakan model tersebut pada kadar berkenaan. 415
Harga itu menjadikan Flash bukan sekadar pelancaran model, tetapi juga produk infrastruktur. Pada kadar sedemikian, pembangun boleh menguji pemprosesan dokumen, ejen pengekodan dan aliran kerja berjumlah besar tanpa menanggung kos premium yang biasanya dikaitkan dengan model AI berkeupayaan tinggi.
Flash-Next bukan sekadar pilihan API kedua. Ia ialah model dengan pemberat terbuka yang bertujuan mempamerkan idea seni bina untuk Qwen4. Repositori model menyenaraikan 125 bilion parameter untuk model utama, tambahan 51 bilion parameter dalam pembenaman N-gram, dan hanya 6 bilion parameter diaktifkan bagi setiap token.
Reka bentuk ini ialah MoE jarang: model mempunyai himpunan parameter yang besar, tetapi setiap token hanya menggunakan sebahagian kecil daripadanya. Secara teori, pendekatan tersebut boleh mengurangkan pengiraan bagi setiap token sambil mengekalkan kapasiti yang lebih besar berbanding model padat dengan saiz keseluruhan yang setara.
Maklumat pada kad model menyenaraikan tetingkap konteks asli sebanyak 262,144 token, yang boleh diperluas sehingga 1 juta token menggunakan YaRN. 13 Oleh sebab Flash dan Flash-Next ialah keluaran yang berbeza, pembangun masih perlu menyemak had tepat, tingkah laku penyajian dan keperluan memori dalam dokumentasi untuk versi yang mahu digunakan.
| Ciri | Qwen3.8-Flash | Qwen3.8-Flash-Next |
|---|---|---|
| Peranan utama | Model produksi berasaskan awan | Pratonton seni bina Qwen4 dengan pemberat terbuka |
| Kegunaan | Pengekodan multimodal, kerja pejabat dan aliran kerja ejen | Pengekodan multimodal, kerja pejabat dan tugasan ejen jangka panjang |
| Konteks | 262,144 token secara lalai; boleh diperluas sehingga 1 juta | 262,144 token secara asli; dilaporkan boleh diperluas sehingga 1 juta menggunakan YaRN |
| Harga hos | $0.16 bagi sejuta token input; $0.47 bagi sejuta token output | Tiada harga API Alibaba ditetapkan untuk pemberat terbuka |
| Angka seni bina | Alibaba menggambarkan barisan Flash sebagai MoE multimodal | Model utama 125B, 51B pembenaman N-gram, 6B aktif bagi setiap token |
| Ketersediaan | API produksi QwenCloud diumumkan untuk dikeluarkan | Maklumat pemberat dan kad model muncul pada penghujung Ogos 2026 |
Masa keluaran itu menguatkan hubungan antara kedua-dua produk. Repositori dan bahan kad model Flash-Next tersedia sebelum atau hampir serentak dengan pengumuman API produksi, membolehkan pembangun melihat seni binanya lebih awal ketika Alibaba menyediakan perkhidmatan terhos. 7
Alibaba berkata barisan Flash baharu memerlukan kira-kira sembilan kali lebih rendah kos latihan berbanding Qwen3.7-Plus, sambil menawarkan prestasi lebih baik khususnya dalam pengekodan dan tugasan pejabat. 515
Itu ialah dakwaan besar dan wajar dibaca sebagai perbandingan yang dilaporkan syarikat, bukannya kajian kos yang diaudit secara bebas. Kos latihan bergantung pada harga perkakasan, tempoh latihan, penyediaan data, percubaan yang gagal dan kaedah perakaunan yang digunakan.
Walau begitu, seni bina jarang memberikan asas teknikal yang munasabah kepada penekanan Alibaba terhadap kecekapan latihan dan inferens: hanya sebahagian daripada parameter yang tersedia diaktifkan untuk setiap token.
Bagi pembeli, perbezaannya lebih mudah. Harga Flash yang terhos boleh terus digunakan untuk membuat anggaran bajet API, manakala angka kos satu per sembilan itu lebih sesuai dianggap sebagai isyarat seni bina dan strategi sehingga ukuran luar yang setanding tersedia.
Kad model Flash-Next yang diterbitkan Alibaba melaporkan keputusan berikut:
Dalam jadual perbandingan yang dipaparkan semula oleh kad model, Flash-Next mencatat skor lebih tinggi daripada keputusan Claude Opus 4.6 Max yang disenaraikan untuk SWE-bench Pro, SWE-bench Multilingual, CoWorkBench dan JobBench. Contohnya, perbandingan SWE-bench Pro yang dilaporkan ialah 62.5 berbanding 53.4, manakala SWE-bench Multilingual ialah 81.0 berbanding 77.5.
Keputusan itu menunjukkan prestasi yang kukuh dalam kejuruteraan perisian dan tugasan ejen di tempat kerja. Namun, ia tidak membuktikan Flash-Next sentiasa lebih baik daripada Claude atau sistem AI berkeupayaan tinggi yang lain. Angka tersebut diterbitkan oleh vendor, tetapan penilaian mungkin berbeza, dan keputusan Flash-Next tidak wajar dianggap secara automatik sebagai prestasi setiap penggunaan produksi Qwen3.8-Flash.
Sumber-sumber yang tersedia menerangkan Flash-Next sebagai model dengan pemberat terbuka. Satu ringkasan model menyenaraikan lesen qwen-community-1.0, tetapi pembangun perlu mengesahkan lesen yang berkuat kuasa dalam repositori dan kad model rasmi sebelum mengedar semula, menala halus atau mengehos model untuk tujuan komersial. 6
Istilah “pemberat terbuka” tidak bermaksud semua penggunaannya bebas tanpa syarat. Lesen mungkin menetapkan keperluan berkaitan pengedaran semula, atribusi, penggunaan yang dibenarkan atau model terbitan. Bukti yang tersedia di sini belum mencukupi untuk membuat kesimpulan lebih luas tentang kebenaran komersial bagi setiap komponen keluaran tersebut.
Pelancaran ini berlaku ketika Alibaba meningkatkan perbelanjaan untuk mengembangkan infrastruktur AI. Reuters melaporkan pendapatan awan suku tahunannya meningkat 45%, manakala perbelanjaan modal meningkat 75% dan keuntungan bersih suku tahunan merosot 75%. 18
Reuters turut melaporkan bahawa Alibaba mengumpul $10 bilion melalui penempatan saham di Hong Kong untuk membiayai cita-cita AI-nya. Angka-angka ini menunjukkan pertukaran yang sedang dibuat: permintaan terhadap awan dan pengkomputeran AI semakin meningkat, tetapi kos membina kapasiti tersebut memberi tekanan segera kepada keuntungan dan aliran tunai.
Dalam keadaan itu, harga rendah boleh menjadi berguna dari sudut strategi walaupun mengehadkan margin model dalam jangka pendek. Inferens murah berpotensi meningkatkan penggunaan infrastruktur awan Alibaba, menarik beban kerja perusahaan dan menjadikan Qwen pilihan lalai bagi pembangun yang membina aplikasi dengan konteks panjang.
Keluaran Flash-Next memperluas capaian Alibaba melepasi API miliknya. Pembangun boleh menguji, mengubah suai dan mengehos model itu sendiri, sekali gus membina kefahaman terhadap alatan dan seni bina Qwen tanpa perlu terus menggunakan QwenCloud.
Model pengedaran ini boleh menyokong Alibaba dalam beberapa cara:
Bukti yang tersedia menyokong tafsiran ini sebagai strategi, tetapi bukan bukti bahawa Qwen sudah memenangi ekosistem pembangun China. Tiada angka semasa yang disahkan tentang jumlah pembangun aktif, muat turun atau penggunaan perusahaan diberikan oleh sumber-sumber berkenaan.
Qwen3.8-Flash dan Flash-Next paling tepat difahami sebagai dua bahagian dalam satu strategi produk. Flash ialah perkhidmatan awan berkonteks panjang yang murah, manakala Flash-Next ialah usaha membina ekosistem dan mempratonton seni bina yang disasarkan kepada Qwen4.
Gabungan harga input $0.16, konteks sehingga 1 juta token, laluan 6 bilion parameter aktif melalui model yang jauh lebih besar serta keputusan penanda aras pengekodan dan ejen yang dilaporkan vendor menjadikan keluaran ini penting kepada pembangun yang memerhatikan ekonomi inferens. 4
Namun, beberapa batasan penting tidak boleh diabaikan. Model produksi dan model pratonton tidak seharusnya dicampuradukkan, dakwaan kos latihan belum diaudit secara bebas, perbandingan penanda aras datang daripada vendor, dan tahap penerimaan belum boleh diukur berdasarkan bukti yang tersedia.
Alibaba kelihatan seperti pesaing serius dengan dana besar dalam persaingan AI China—tetapi bukan pemimpin yang tidak tercabar. Kesediaannya berbelanja besar menunjukkan Qwen dianggap sebagai pertaruhan jangka panjang terhadap perkhidmatan awan dan ekosistem pembangun, bukannya pusat keuntungan jangka pendek. 18
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Alibaba memasangkan Qwen3.8 Flash, model multimodal berasaskan awan pada harga $0.16 bagi sejuta token input dan $0.47 bagi sejuta token output, dengan Flash Next, pratonton seni bina Qwen4 yang mempunyai pemberat ter...
Alibaba memasangkan Qwen3.8 Flash, model multimodal berasaskan awan pada harga $0.16 bagi sejuta token input dan $0.47 bagi sejuta token output, dengan Flash Next, pratonton seni bina Qwen4 yang mempunyai pemberat ter... Flash Next menggabungkan model utama 125 bilion parameter dengan 51 bilion parameter pembenaman N gram, tetapi hanya mengaktifkan 6 bilion parameter bagi setiap token untuk mengurangkan kos pengiraan.
Strategi ini hadir ketika pendapatan awan Alibaba meningkat 45%, tetapi perbelanjaan modal melonjak 75% dan keuntungan bersih suku tahunannya merosot 75% akibat pelaburan infrastruktur AI.