Ling 3.0 flash VL adalah model open weight berlisensi MIT dari inclusionAI milik Ant Group yang menerima masukan teks, gambar, dan video. Arsitektur MoE nya memiliki 124 miliar parameter total, tetapi sekitar 5,5 miliar parameter yang aktif per token; model ini mendukung konteks hingga 256K token.
Diterbitkan olehDiedit dengan GPT-5.6 TerraGambar dibuat dengan GPT Image 2
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL adalah model bahasa-visual (vision-language model) open-weight dari inclusionAI dan Ant Group, yang dibangun di atas keluarga model penalaran Ling-3.0-flash. Sorotan teknisnya adalah desain mixture-of-experts (MoE) yang jarang (sparse): model ini memiliki 124 miliar parameter total, tetapi hanya sekitar 5,5 miliar parameter yang diaktifkan untuk setiap token. Tujuannya adalah mempertahankan kapasitas model besar sambil menekan komputasi per token dibandingkan model padat (dense) berukuran 124B parameter. 3
12
Yang membuatnya lebih menonjol, Ling-3.0-flash-VL diposisikan sebagai agen visual. Jadi, gambar bukan sekadar lampiran yang diproses sekali untuk diberi deskripsi atau dijawab pertanyaannya. Model ini dirancang untuk memakai informasi visual sepanjang pengerjaan tugas: memeriksa layar atau dokumen, melakukan tindakan lewat alat eksternal, meninjau keadaan terbaru, lalu memverifikasi atau membetulkan hasilnya. Ant Group menyebut pendekatan ini sebagai visual feedback closed loop atau siklus tertutup umpan balik visual. 12
Ling-3.0-flash-VL menerima teks, gambar, dan video sebagai masukan, lalu menghasilkan keluaran teks. Jendela konteks yang dinyatakan mencapai 256K token, sehingga model ini ditujukan untuk dokumen panjang, percakapan multimodal yang ekstensif, serta alur kerja agen yang perlu menyimpan riwayat tugas dalam jumlah besar. 3
4
Sejumlah laporan menggambarkan arsitektur hibrida yang memadukan Kimi Delta Attention dan lapisan gated multi-head latent attention. Untuk video, model memakai pengodean posisi VideoRoPE yang ditujukan untuk mempertahankan informasi temporal antar-frame. 1
6
Arsitektur ini penting karena pembuatnya menempatkan konten visual sebagai bagian dari aliran penalaran, bukan fitur tambahan yang baru ditempelkan pada tahap akhir model teks. Inilah dasar klaimnya sebagai model multimodal native. 1
12
Model MoE memiliki banyak kelompok parameter khusus, yang lazim disebut expert. Mekanisme perutean memilih hanya sebagian expert untuk sebuah token. Pada Ling-3.0-flash-VL, kapasitas totalnya dilaporkan 124B parameter, sementara yang aktif sekitar 5,5B parameter per token. 3
12
Perbedaannya punya dampak praktis:
Ini bukan berarti kebutuhan infrastrukturnya ringan. Menjalankan weights terbuka berukuran besar tetap membutuhkan memori besar dan rekayasa sistem yang cermat. Namun, desain tersebut menjelaskan mengapa model ini dipasarkan sebagai varian “flash” meski jumlah parameter totalnya sangat besar. 3
5
Sistem bahasa-visual konvensional dapat berguna untuk tugas sekali jalan, misalnya mendeskripsikan foto, mengekstrak teks dari struk, atau menjawab pertanyaan tentang grafik. Ling-3.0-flash-VL diarahkan untuk siklus yang lebih panjang:
Rancangan ini relevan untuk otomasi GUI (graphical user interface) dan tugas perangkat lunak yang berbasis visual. Sebagai contoh, model dapat memeriksa kondisi antarmuka, memilih tindakan, melihat perubahan pada layar, lalu menilai apakah kondisi tujuan telah tercapai.
Namun, modelnya sendiri tidak menggantikan browser, izin penggunaan alat, maupun pagar pengaman alur kerja. Sistem di sekeliling model itulah yang menentukan tindakan apa yang benar-benar bisa dilakukan.
Ant Group dan laporan terkait menyebut pembuatan front-end, otomasi GUI, serta interpretasi laporan medis sebagai sasaran penggunaan. 12 Interpretasi laporan medis harus dipahami sebagai penggunaan untuk membantu alur kerja, bukan bukti bahwa model aman atau andal secara mandiri untuk keputusan klinis.
Model ini dirilis sebagai open weights di bawah lisensi MIT. Versi bobot BF16 dan FP8 dilaporkan tersedia, sedangkan versi FP4 dan INT4 disebut masih direncanakan atau akan hadir dalam cakupan peluncuran awal. 3
4
Panduan penyajian (serving) juga dilaporkan tersedia untuk SGLang dan jalur vLLM yang disetel untuk Ling. 3
4 Untuk penerapan produksi, hal itu sebaiknya diperlakukan sebagai titik awal, bukan jaminan kompatibilitas. Operator tetap perlu menguji revisi model, kuantisasi, prapemrosesan multimodal, panjang konteks, perangkat keras, dan versi framework yang benar-benar akan dipakai.
Terdapat dua angka Artificial Analysis Intelligence Index yang muncul dalam pemberitaan:
Kedua angka itu tidak harus saling bertentangan karena versi indeks yang mendasarinya berubah. Namun, keduanya tidak boleh dibandingkan seolah-olah berasal dari skala pengujian yang sama. Kesimpulan yang lebih tepat: model ini dilaporkan kompetitif dari sisi efisiensi relatif terhadap jumlah parameter aktifnya. Itu sendiri belum membuktikan bahwa model akan andal pada semua alur kerja agen, produksi, atau klinis. 3
4
Nilai penting Ling-3.0-flash-VL bukan sekadar bahwa Ling kini menerima gambar dan video. Model ini dipresentasikan sebagai model terbuka pertama dalam lini Ling yang memasukkan penglihatan ke dalam perencanaan iteratif, tindakan, pemeriksaan visual, dan koreksi. Desain MoE yang jarang ditujukan agar pendekatan agen multimodal tersebut lebih hemat komputasi daripada model padat dengan ukuran setara. 3
12
Bagi pengembang, penggunaan yang paling masuk akal adalah alur kerja terbatas, dengan bukti visual yang relevan dan setiap tindakan alat dapat diuji: memeriksa halaman web hasil render terhadap desain, menavigasi antarmuka yang terkontrol, atau mengekstrak sekaligus mencocokkan informasi lintas dokumen. Demo dan evaluasi yang dilaporkan vendor adalah sinyal yang menjanjikan, tetapi penerapan andal tetap bergantung pada evaluasi khusus tugas, pengendalian izin, penanganan kesalahan, dan pengawasan manusia.
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Ling 3.0 flash VL adalah model open weight berlisensi MIT dari inclusionAI milik Ant Group yang menerima masukan teks, gambar, dan video.
Ling 3.0 flash VL adalah model open weight berlisensi MIT dari inclusionAI milik Ant Group yang menerima masukan teks, gambar, dan video. Arsitektur MoE nya memiliki 124 miliar parameter total, tetapi sekitar 5,5 miliar parameter yang aktif per token; model ini mendukung konteks hingga 256K token.
Keunggulan utamanya adalah siklus umpan balik visual: mengamati, bertindak melalui alat, memverifikasi hasil visual, lalu mengoreksi langkah berikutnya.