Ling 3.0 flash VL ialah model berat terbuka berlesen MIT daripada inclusionAI, unit AI Ant Group, yang menerima input teks, imej dan video. Model ini mempunyai konteks sehingga 256K token serta berat BF16 dan FP8; versi FP4 dan INT4 dilaporkan sebagai masih dalam perancangan atau akan menyusul.
Diterbitkan olehDisunting dengan GPT-5.6 TerraImej dijana dengan GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL ialah model vision-language berberat terbuka daripada inclusionAI dan Ant Group, dibina berasaskan keluarga penaakulan Ling-3.0-flash. Ciri teknikal utamanya ialah reka bentuk mixture-of-experts (MoE) jarang: jumlahnya 124 bilion parameter, tetapi hanya sekitar 5.5 bilion parameter diaktifkan bagi setiap token. Matlamatnya ialah menyediakan kapasiti model besar dengan penggunaan pengiraan bagi setiap token yang lebih rendah berbanding model padat 124B parameter. 3
12
Perkara yang lebih membezakannya ialah kedudukannya sebagai ejen visual. Model ini bukan sekadar melihat imej sekali untuk menulis kapsyen atau menjawab soalan. Ia direka untuk menggunakan maklumat visual sepanjang tugasan: memeriksa skrin atau dokumen, melakukan tindakan melalui alat luaran, menilai keadaan baharu, kemudian mengesahkan atau membetulkan kerjanya. Ant Group menyifatkannya sebagai gelung tertutup maklum balas visual. 12
Ling-3.0-flash-VL menerima teks, imej dan video sebagai input, dengan output dalam bentuk teks. Ia mempunyai tetingkap konteks sehingga 256K token, yang menjadikannya sesuai untuk dokumen panjang, perbualan multimodal yang berpanjangan dan aliran kerja ejen yang perlu mengekalkan sejarah tugasan yang banyak. 3
4
Laporan yang tersedia menerangkan seni bina hibrid yang menggabungkan Kimi Delta Attention dengan lapisan gated multi-head latent attention. Bagi video, model ini menggunakan pengekodan kedudukan VideoRoPE untuk membantu mengekalkan maklumat masa merentas bingkai video. 1
6
Maksud penting di sebalik reka bentuk ini ialah kandungan visual diposisikan sebagai sebahagian daripada aliran penaakulan, bukannya ciri tambahan pada penghujung model teks. Inilah asas kepada kedudukan model itu sebagai model multimodal natif. 1
12
Model MoE mempunyai beberapa kumpulan parameter khusus, lazimnya dipanggil pakar (experts). Mekanisme penghalaan akan memilih hanya sebahagian pakar bagi sesuatu token. Bagi Ling-3.0-flash-VL, laporan meletakkan model ini pada 124B parameter keseluruhan dan kira-kira 5.5B parameter aktif bagi setiap token. 3
12
Perbezaan itu membawa implikasi operasi yang penting:
Ini tidak bermakna keperluan infrastruktur menjadi kecil — pengehosan berat terbuka berskala besar masih memerlukan memori yang besar dan kejuruteraan sistem yang teliti. Namun, ia menjelaskan mengapa model ini dipasarkan dalam kategori “flash”, walaupun jumlah parameternya tinggi. 3
5
Sistem vision-language biasa berguna untuk tugasan sekali jalan, seperti menghuraikan foto, mengekstrak teks daripada resit atau menjawab soalan tentang carta. Ling-3.0-flash-VL pula disasarkan kepada kitaran yang lebih panjang:
Reka bentuk ini khususnya relevan untuk automasi GUI dan tugasan perisian yang bergantung pada paparan visual. Sebagai contoh, model boleh memeriksa keadaan semasa sebuah antara muka, memilih tindakan, melihat perubahan pada skrin, lalu menentukan sama ada keadaan yang dikehendaki telah dicapai.
Walau bagaimanapun, model itu sendiri tidak menggantikan pelayar, kebenaran penggunaan alat atau kawalan keselamatan aliran kerja di sekelilingnya. Sistem-sistem itulah yang menentukan tindakan sebenar yang boleh dilakukannya.
Ant Group dan laporan berkaitan menyenaraikan penjanaan bahagian hadapan, automasi GUI dan pentafsiran laporan perubatan sebagai kes penggunaan sasaran. 12 Pentafsiran laporan perubatan perlu dilihat sebagai penggunaan bantuan aliran kerja, bukannya bukti kebolehpercayaan atau keselamatan klinikal secara autonomi.
Model ini dikeluarkan sebagai berat terbuka di bawah lesen MIT, dengan versi berat BF16 dan FP8 dilaporkan tersedia. Binaan FP4 dan INT4 pula dihuraikan sebagai dirancang atau bakal menyusul dalam liputan awal pelancaran. 3
4
Panduan penyajian turut dilaporkan tersedia untuk SGLang dan laluan vLLM yang ditala untuk Ling. 3
4 Bagi penggunaan produksi, ini wajar dianggap sebagai titik permulaan, bukan jaminan keserasian: pengendali perlu menguji semakan model, kuantisasi, prapemprosesan multimodal, panjang konteks, perkakasan dan versi rangka kerja yang tepat untuk digunakan.
Dua angka Artificial Analysis Intelligence Index dilaporkan dalam liputan model ini:
Angka ini tidak semestinya bercanggah kerana versi indeks asas telah berubah. Namun, kedua-duanya tidak boleh dibandingkan seolah-olah datang daripada skala ujian yang sama. Kesimpulan yang lebih berhati-hati ialah model ini menunjukkan kecekapan kompetitif berbanding bilangan parameter aktifnya. Itu sahaja belum membuktikan ia boleh diharap untuk setiap aliran kerja ejen, penggunaan produksi atau situasi klinikal. 3
4
Kepentingannya bukan semata-mata kerana Ling kini menerima imej dan video. Ling-3.0-flash-VL dibentangkan sebagai model terbuka pertama dalam siri Ling yang memasukkan penglihatan ke dalam perancangan berulang, tindakan, semakan visual dan pembetulan. Reka bentuk MoE jarangnya pula bertujuan menjadikan pendekatan ejen multimodal ini lebih cekap dari segi pengiraan berbanding model padat dengan skala parameter yang setara. 3
12
Bagi pembangun, kes penggunaan yang paling munasabah ialah aliran kerja terkawal, apabila bukti visual penting dan setiap tindakan alat boleh diuji: menyemak halaman yang dirender berbanding reka bentuk rujukan, menavigasi antara muka terkawal, atau mengekstrak serta menyemak silang maklumat merentas dokumen. Demo dan penilaian yang dilaporkan vendor ialah petunjuk yang menggalakkan, tetapi pelaksanaan yang boleh diharap tetap bergantung pada penilaian khusus tugasan, kawalan kebenaran, pengendalian ralat dan pengawasan manusia.
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash VL ialah model berat terbuka berlesen MIT daripada inclusionAI, unit AI Ant Group, yang menerima input teks, imej dan video.
Ling 3.0 flash VL ialah model berat terbuka berlesen MIT daripada inclusionAI, unit AI Ant Group, yang menerima input teks, imej dan video. Model ini mempunyai konteks sehingga 256K token serta berat BF16 dan FP8; versi FP4 dan INT4 dilaporkan sebagai masih dalam perancangan atau akan menyusul.
Skor 42 dan 25 yang dilaporkan datang daripada versi berbeza Artificial Analysis Intelligence Index, jadi kedua duanya tidak boleh dibandingkan secara terus.