Ling 3.0 flash memiliki 124 miliar parameter total, tetapi hanya mengaktifkan sekitar 5,1 miliar parameter per token melalui arsitektur mixture of experts (MoE). Ant mengklaim model ini menyamai atau melampaui Ring 2.6 1T pada sebagian besar benchmark internal, tetapi klaim tersebut tetap perlu diuji pada beban kerj...
Jawaban penelitian

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Bagi tim yang menjalankan agen AI untuk menulis kode, membaca dokumen, memanggil API, lalu mencoba lagi ketika hasilnya gagal, ukuran model bukan satu-satunya pertimbangan. Pertanyaan yang lebih praktis adalah: model mana yang memberi kualitas tugas memadai dengan latensi dan biaya inferensi serendah mungkin?
Ling-3.0-flash dari Ant Group menjadi contoh menarik dari pergeseran tersebut. Model ini mempunyai 124 miliar parameter total, tetapi hanya mengaktifkan sekitar 5,1 miliar parameter untuk setiap token. Ant memosisikannya sebagai model hybrid reasoning hemat biaya untuk tugas berfrekuensi tinggi, dengan konteks native 256K token yang dapat diperpanjang hingga 1 juta token.
Ling-3.0-flash menggunakan pendekatan mixture-of-experts (MoE). Alih-alih menjalankan seluruh parameter setiap kali menghasilkan token, model merutekan pekerjaan ke sebagian kecil “pakar” yang paling relevan.
Artinya, model tetap memiliki kumpulan bobot besar untuk menyimpan kapasitas pembelajaran, sementara jejak komputasi aktif saat inferensi jauh lebih kecil. Ant menyebut ukuran total Ling-3.0-flash sekitar 12,4% dari model Ring-2.6-1T kelas 1 triliun parameter, sedangkan parameter aktifnya hanya 8,1%. Materi rilisnya juga menjelaskan arsitektur hybrid linear attention yang mengombinasikan lapisan KDA dan MLA, bersama perutean MoE yang sparse.
Jumlah parameter total tentu belum menjadi tidak penting. Kapasitas total masih memengaruhi apa yang dapat direpresentasikan sebuah model, dan kualitas mekanisme perutean menentukan seberapa baik MoE bekerja. Namun, aktivasi sparse mengubah hitungan ekonominya: kecepatan dan biaya penyajian lebih berkaitan dengan parameter serta komputasi perhatian yang benar-benar dipakai per token, bukan seluruh parameter yang tersimpan.
Ant menyatakan Ling-3.0-flash menyamai atau melampaui Ring-2.6-1T di sebagian besar perbandingan benchmark yang dipublikasikannya. Akun Ling milik Ant di X juga menyebut model ini dapat menyamai atau mengungguli flagship 1T mereka pada sebagian besar benchmark, dengan kira-kira seperdelapan parameter total dan seperdua belas parameter aktif.
Ini merupakan perbandingan internal yang penting, terutama karena Ling-3.0-flash memang ditujukan untuk beban kerja agen di lingkungan produksi. Namun, hal itu bukan bukti bahwa model tersebut lebih baik daripada seluruh model general-purpose berukuran lebih besar untuk semua jenis tugas.
Ada beberapa batasan yang perlu diingat:
Karena itu, uji yang paling bermakna bagi perusahaan adalah menjalankan model pada beban kerja representatif: skema tool yang benar-benar digunakan, konteks repositori, target latensi, pola retry, dan dampak dari kesalahan keluaran.
Kartu model Ling-3.0-flash mencantumkan evaluasi seperti SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas, dan SkillsBench. Model ini juga disebut digunakan pada lingkungan berorientasi agen seperti Claude Code, Kilo Code, Qwen Code, Hermes Agent, dan OpenClaw. 1
Sasaran ini relevan karena sistem agen dapat menghasilkan volume token yang sangat besar. Satu workflow dapat membaca banyak berkas, memanggil tool, menerima hasil, mengoreksi rencana, lalu mengulangi eksekusi. Konsumsi tokennya bisa jauh melampaui satu jawaban chatbot biasa.
Dalam situasi seperti itu, model yang murah dan cepat—selama cukup andal untuk langkah rutin—dapat lebih bernilai daripada memakai model general-purpose yang lebih mahal pada setiap giliran. Pola implementasi yang masuk akal adalah:
Ant mendokumentasikan jendela konteks native 256K token yang dapat diperluas hingga 1 juta token. Ini berpotensi membantu saat model perlu menangani basis kode besar, jejak pemanggilan tool yang panjang, atau status kerja yang terus dipertahankan.
OpenRouter mencantumkan konteks yang disajikan sebesar 262.144 token untuk Ling-3.0-flash. 6
Meski demikian, konteks panjang tidak otomatis berarti model ini terbukti unggul untuk sistem multi-agen. Konteks besar memang dapat memudahkan penyimpanan informasi bersama dalam sebuah workflow, tetapi sistem multi-agen yang andal juga memerlukan orkestrasi, rancangan memori, izin tool, mekanisme serah-terima tugas, dan evaluasi yang baik. Sumber yang tersedia mendukung spesifikasi konteks panjang serta posisinya untuk agen, tetapi belum mendukung klaim kuantitatif bahwa ia mengalahkan pesaing dalam penerapan multi-agen.
Ling-3.0-flash diperkenalkan pada 24 Juli 2026. Menurut unggahan rilis Ant, API gratis dalam waktu terbatas tersedia di OpenRouter dan platform Ant hingga 3 Agustus. Model ini juga tersedia di Hugging Face, yang menyoroti fokusnya pada benchmark serta framework agen. 1
Di OpenRouter, tarif yang tercantum adalah US$0,021 per 1 juta token input dan US$0,063 per 1 juta token output, dengan konteks 262.144 token. 6 Tarif tersebut membuat pengujian workflow bervolume tinggi menjadi lebih terjangkau, walaupun biaya aktual, latensi, ketersediaan, dan kualitas keluaran dapat berbeda menurut penyedia serta kondisi deployment.
Halaman penemuan model OpenRouter mencatat persentil terpisah untuk Ling-3.0-flash: 49 untuk intelligence, 56 untuk coding, dan 54 untuk agentic. Angka ini menegaskan bahwa satu peringkat utama saja tidak cukup untuk menilai model yang difokuskan pada eksekusi. 12
Rilis ini bertepatan dengan unggahan pertama Jensen Huang di X. CEO Nvidia itu membagikan surat yang berargumen bahwa model terbuka memperkuat keamanan dan keamanan siber, mempercepat inovasi serta penyebaran teknologi, dan mendukung kedaulatan teknologi—berdampingan dengan model frontier tertutup.
Waktunya memang menjadikan Ling-3.0-flash contoh yang relevan dalam perdebatan soal AI berbobot terbuka (open-weight): pengembang dapat memeriksa, meng-hosting, menyetel, dan mengintegrasikan model secara lebih langsung ketika bobotnya tersedia. Namun, dua peristiwa tersebut tidak membuktikan adanya kemitraan atau hubungan teknis antara Nvidia dan Ant Group.
Kekuatan utama Ling-3.0-flash adalah sebagai bukti untuk strategi model eksekusi dengan biaya yang disesuaikan terhadap hasil. MoE sparse memungkinkan kapasitas tersimpan yang besar dipadukan dengan aktivasi per token yang jauh lebih kecil. Bagi loop agen yang berulang, pendekatan itu berpotensi memangkas biaya dan mempercepat respons tanpa memaksa tim memakai model kecil dengan keterbatasan lebih besar.
Klaim performanya tetap perlu direplikasi secara independen, dan model ini tidak sepatutnya dianggap sebagai pengganti universal bagi sistem general-purpose terbesar. Tetapi spesifikasi, sasaran evaluasi agentik, konteks panjang, dan tarif API yang rendah memberi alasan kuat untuk mengujinya—terutama ketika biaya inferensi dan latensi menjadi batas utama. 1
6
Studio Global AI
Halaman ini berisi jawaban yang didukung sumber yang dapat Anda lanjutkan di dalam Studio Global.
Ling 3.0 flash memiliki 124 miliar parameter total, tetapi hanya mengaktifkan sekitar 5,1 miliar parameter per token melalui arsitektur mixture of experts (MoE).
Ling 3.0 flash memiliki 124 miliar parameter total, tetapi hanya mengaktifkan sekitar 5,1 miliar parameter per token melalui arsitektur mixture of experts (MoE). Ant mengklaim model ini menyamai atau melampaui Ring 2.6 1T pada sebagian besar benchmark internal, tetapi klaim tersebut tetap perlu diuji pada beban kerja nyata dan dievaluasi secara independen.
Jendela konteks native 256K token, fokus pada coding serta tool use, dan tarif API OpenRouter yang rendah membuatnya relevan untuk workflow agen bervolume tinggi.