Qwen3.8 Omni Flash menerima teks, imej, audio dan video secara asli, dengan tetingkap konteks sehingga 1 juta token. Alibaba melaporkan peningkatan purata lebih 25% berbanding Qwen3.5 Omni Plus dalam 29 penilaian; pemprosesan video terpilih pula bertujuan mengurangkan token yang digunakan.
Diterbitkan olehDisunting dengan GPT-6 SolImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Jika rakaman mesyuarat berlangsung sejam, tugas AI yang berguna bukan sekadar menerangkan apa yang didengarnya. Ia perlu mengenal pasti siapa yang bercakap, mencari keputusan penting dan menyediakan tindakan susulan. Itulah jenis aliran kerja yang ingin disokong oleh Qwen3.8-Omni-Flash, model Alibaba yang dilancarkan pada September 2026 dan tersedia melalui platform Qwen AI. 2
52
Model ini menerima teks, imej, audio dan video secara asli dalam satu aliran kerja, dengan tetingkap konteks sehingga 1 juta token—iaitu ruang untuk mengekalkan sejumlah besar maklumat ketika memproses sesuatu tugasan. Matlamatnya ialah membolehkan agen AI memahami bahan bercampur, merancang langkah seterusnya, menggunakan alat dan menghasilkan jawapan atau hasil kerja tanpa perlu menyerahkan setiap jenis input kepada model yang berasingan. Model asas ini menghasilkan teks; keupayaan output audio bagi interaksi langsung datang melalui varian Realtime. 1
2
5
16
Bagi video panjang, memproses setiap bingkai secara berterusan boleh menggunakan banyak token. Pendekatan terpilih membolehkan agen bermula dengan soalan, kemudian meneliti bahagian rakaman yang relevan. Alibaba melaporkan penggunaan token 51.8% lebih rendah berbanding kaedah pemahaman statik dalam ujian OmniVideoBench. Syarikat itu juga melaporkan skor purata lebih 25% lebih tinggi daripada Qwen3.5-Omni-Plus merentas 29 penilaian. Kedua-duanya ialah keputusan ujian yang dilaporkan, bukan jaminan bahawa setiap aplikasi akan memperoleh peningkatan atau penjimatan yang sama. 12
16
Konteks yang besar membantu apabila tugasan melibatkan pertuturan, paparan video dan bahan rujukan yang perlu difahami bersama. Untuk input audio-video mesyuarat sehingga sejam, Qwen3.8-Omni-Flash dilaporkan boleh membezakan penutur, mentranskripsi perbincangan dan memadankan suara dengan individu pada skrin. Agen kemudian boleh menggunakan dapatan itu untuk menyediakan hasil seperti minit mesyuarat atau tindakan susulan, bukannya hanya memberikan gambaran umum rakaman. 2
52
Alibaba turut memperluas Qwen-MM-Plugins, komponen sumber terbuka untuk membantu rangka kerja agen mengakses keupayaan audio-video dan menjalankan aliran kerja panjang. Qwen-Live Harness, yang dikeluarkan secara berasingan sebagai sumber terbuka, ditujukan kepada interaksi multimodal yang berterusan dan masa nyata. Ini tidak bermaksud pemberat model Qwen3.8-Omni-Flash sendiri dikeluarkan sebagai sumber terbuka. 5
52
Bagi kegunaan langsung, varian Qwen3.8-Omni-Flash-Realtime menyokong input audio dan video masa nyata dengan output teks serta audio. Dokumentasi Qwen turut menyenaraikan audio berbilang saluran, pengagregatan video dan alat MCP jarak jauh, iaitu cara menghubungkan agen kepada alat luaran. 1
Alibaba menyatakan kos input API setiap jam turun lebih 98% untuk audio dan lebih 93% untuk gabungan audio-video. Bersama pemprosesan video terpilih, pengurangan ini menjadikan tugasan yang perlu mendengar, melihat dan menggunakan alat berulang kali lebih munasabah dari segi kos. Namun, bil sebenar masih bergantung pada bahan yang diproses, bilangan token, panjang output dan alat yang dipanggil; peratus penurunan tersebut tidak boleh dianggap sebagai anggaran kos untuk setiap penggunaan sebenar. 12
16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Omni Flash menerima teks, imej, audio dan video secara asli, dengan tetingkap konteks sehingga 1 juta token.
Qwen3.8 Omni Flash menerima teks, imej, audio dan video secara asli, dengan tetingkap konteks sehingga 1 juta token. Alibaba melaporkan peningkatan purata lebih 25% berbanding Qwen3.5 Omni Plus dalam 29 penilaian; pemprosesan video terpilih pula bertujuan mengurangkan token yang digunakan.
Pemalam dan rangka kerja sumber terbuka menyokong aliran kerja panjang serta interaksi langsung.