Ling 3.0 flash mempunyai 124B parameter keseluruhan, tetapi mengaktifkan kira kira 5.1B parameter bagi setiap token—contoh bagaimana MoE jarang boleh mengurangkan pengiraan semasa inferens. Model ini disasarkan kepada tugas ejen berulang seperti pengekodan, panggilan alat dan aliran kerja, dengan konteks asli 256K t...
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Bagi pasukan yang membina ejen AI, soalan praktikal selalunya bukan lagi model mana paling besar? Sebaliknya: model mana memberikan kualiti kerja yang memadai pada kos dan kependaman paling rendah?
Ling-3.0-flash daripada Ant Group ialah contoh jelas perubahan keutamaan ini. Model tersebut mempunyai 124 bilion (124B) parameter secara keseluruhan, namun hanya mengaktifkan kira-kira 5.1 bilion (5.1B) parameter bagi setiap token. Ant meletakkannya sebagai model penaakulan hibrid yang menjimatkan kos untuk tugas berfrekuensi tinggi, dengan tetingkap konteks asli 256K token yang boleh dikembangkan kepada 1 juta token.
Ling-3.0-flash menggunakan pendekatan mixture-of-experts (MoE), atau campuran pakar. Dalam seni bina ini, model tidak menggunakan semua parameter untuk memproses setiap token. Sebaliknya, ia menghalakan tugas kepada sebahagian kecil “pakar” yang dianggap paling relevan.
Secara mudah, model masih menyimpan himpunan pengetahuan dan keupayaan yang besar, tetapi jejak pengiraan untuk setiap token adalah jauh lebih kecil. Menurut Ant, Ling-3.0-flash hanya mempunyai kira-kira 12.4% daripada jumlah parameter dan 8.1% daripada parameter aktif model Ring-2.6-1T kelas 1 trilion parameternya. Bahan pelancaran Ant turut menerangkan seni bina perhatian linear hibrid yang berselang antara lapisan KDA dan MLA, bersama penghalaan MoE jarang.
Ini tidak bermakna jumlah parameter sudah tidak penting. Kapasiti keseluruhan masih boleh mempengaruhi apa yang boleh dipelajari atau diwakili oleh model, manakala mutu sistem penghalaan menentukan sama ada MoE benar-benar dapat memanfaatkan kapasiti tersebut. Namun, pengaktifan jarang mengubah kira-kira ekonomi: kos penyajian dan kelajuan lebih berkait dengan parameter serta pengiraan perhatian yang digunakan bagi setiap token, bukan semata-mata semua parameter yang disimpan dalam model.
Ant menyatakan Ling-3.0-flash menyamai atau mengatasi Ring-2.6-1T dalam kebanyakan perbandingan penanda aras yang diterbitkannya. Akaun Ling milik Ant di X turut menggambarkan hasil itu sebagai setanding atau lebih baik daripada model utama 1T mereka dalam kebanyakan penanda aras, dengan kira-kira satu perlapan jumlah parameter dan satu perdua belas parameter aktif.
Ini ialah perbandingan dalaman yang menarik, khususnya kerana model itu memang disasarkan kepada beban kerja ejen dalam persekitaran produksi. Namun, ia bukan bukti bahawa Ling-3.0-flash lebih baik daripada semua model guna am yang lebih besar bagi setiap tugasan.
Beberapa peringatan penting:
Jadi, penilaian yang paling berguna ialah menggunakan beban kerja sendiri: skema alat sebenar, konteks repositori, sasaran kependaman, corak percubaan semula dan kos jika model tersilap.
Kad model Ling-3.0-flash menyenaraikan penilaian seperti SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas dan SkillsBench. Ia juga menyatakan penggunaan bersama persekitaran berorientasikan ejen seperti Claude Code, Kilo Code, Qwen Code, Hermes Agent dan OpenClaw. 1
Sasaran ini relevan kerana sistem ejen boleh menggunakan token dalam jumlah besar. Ejen yang membaca fail, memanggil alat, menerima hasil, menyemak pelan dan mencuba semula langkahnya boleh menggunakan jauh lebih banyak token daripada satu jawapan sembang biasa.
Dalam keadaan itu, model yang lebih murah tetapi boleh mengendalikan langkah pelaksanaan rutin dengan konsisten mungkin lebih bernilai daripada menggunakan model penaakulan guna am yang mahal pada setiap giliran. Pendekatan yang munasabah ialah:
Ant mendokumenkan tetingkap konteks asli 256K token, yang boleh dilanjutkan kepada 1 juta token. Ia berguna untuk pangkalan kod yang panjang, jejak panggilan alat yang besar atau keadaan kerja berterusan.
OpenRouter pula menyenaraikan tetingkap konteks tersaji sebanyak 262,144 token untuk model ini. 6
Namun, konteks panjang sahaja tidak patut dianggap sebagai bukti keupayaan sistem berbilang ejen yang telah disahkan. Ia boleh memudahkan perkongsian maklumat sepanjang aliran kerja, tetapi sistem berbilang ejen yang boleh diharap turut bergantung pada orkestrasi, reka bentuk memori, kebenaran alat, serahan tugas dan penilaian. Sumber yang tersedia menyokong spesifikasi konteks panjang serta kedudukan model sebagai model ejen, bukan dakwaan kuantitatif bahawa ia mengatasi pesaing dalam pelaksanaan berbilang ejen.
Ling-3.0-flash diperkenalkan pada 24 Julai 2026. Menurut hantaran pelancaran Ant, API percuma untuk tempoh terhad disediakan di OpenRouter dan platform Ant hingga 3 Ogos. Model ini juga tersedia di Hugging Face, dengan penekanan pada penanda aras dan rangka kerja ejen. 1
Di OpenRouter, harga yang disenaraikan ialah AS$0.021 bagi sejuta token input dan AS$0.063 bagi sejuta token output, dengan konteks 262,144 token. 6 Harga itu memudahkan ujian aliran kerja bervolum tinggi, walaupun kos sebenar, kependaman, ketersediaan dan mutu output boleh berubah mengikut penyedia serta keadaan penggunaan.
Halaman penemuan model OpenRouter pula menyenaraikan peratusil berasingan untuk kecerdasan, pengekodan dan keupayaan ejen—masing-masing 49, 56 dan 54. Ini menunjukkan sebab satu kedudukan tunggal tidak mencukupi untuk menilai model yang memberi fokus pada pelaksanaan. 12
Pelancaran tersebut berlaku pada hari yang sama Jensen Huang membuat hantaran pertama beliau di X. Ketua Pegawai Eksekutif Nvidia itu berkongsi surat yang berhujah bahawa model terbuka dapat mengukuhkan keselamatan dan keselamatan siber, mempercepat inovasi serta penyebaran teknologi, dan menyokong kedaulatan teknologi di samping model tertutup termaju.
Kebetulan masa itu menjadikan Ling-3.0-flash contoh yang sesuai dalam perdebatan mengenai AI berat terbuka: pembangun boleh meneliti, menghoskan, melaras dan mengintegrasikan model dengan lebih langsung apabila berat model tersedia. Tetapi kedua-dua peristiwa itu tidak membuktikan sebarang perkongsian atau hubungan teknikal antara Nvidia dengan Ant Group.
Kekuatan utama Ling-3.0-flash ialah sebagai bukti bagi strategi model pelaksanaan yang dinilai mengikut kos. MoE jarang boleh menggabungkan kapasiti tersimpan yang luas dengan pengaktifan jauh lebih kecil bagi setiap token. Secara teori dan dalam penggunaan yang sesuai, ini boleh menjadikan gelung ejen yang kerap lebih cepat serta lebih murah tanpa perlu menerima batasan model kecil.
Dakwaan prestasinya masih memerlukan pengesahan bebas dan model ini tidak wajar dianggap pengganti menyeluruh bagi sistem guna am terbesar. Namun, spesifikasinya, sasaran penilaian ejen, konteks panjang dan harga API yang rendah menjadikannya calon yang kukuh untuk diuji apabila kos inferens serta kependaman menjadi kekangan utama. 1
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash mempunyai 124B parameter keseluruhan, tetapi mengaktifkan kira kira 5.1B parameter bagi setiap token—contoh bagaimana MoE jarang boleh mengurangkan pengiraan semasa inferens.
Ling 3.0 flash mempunyai 124B parameter keseluruhan, tetapi mengaktifkan kira kira 5.1B parameter bagi setiap token—contoh bagaimana MoE jarang boleh mengurangkan pengiraan semasa inferens. Model ini disasarkan kepada tugas ejen berulang seperti pengekodan, panggilan alat dan aliran kerja, dengan konteks asli 256K token yang boleh dilanjutkan hingga 1M token.
Dakwaan prestasi Ant Group terhadap model 1T miliknya sendiri penting, tetapi wajar diuji pada beban kerja sebenar kerana penanda aras dan kedudukan pihak ketiga memberikan gambaran yang lebih bercampur.