Ling 3.0 flash має 124 млрд загальних параметрів, проте для кожного токена задіює приблизно 5,1 млрд — це основа її потенційної економічності. Модель орієнтована на часті задачі: програмування, виклики інструментів, пошук, форматування та багатоетапні агентні процеси.
Research answer

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Для систем штучного інтелекту, які багато разів читають файли, викликають інструменти, отримують результати та виправляють власний план, ключове питання дедалі частіше звучить не як «яка модель найбільша?». Практичніше запитати: яка модель забезпечує прийнятну якість за найменшої затримки й вартості інференсу?
Ling-3.0-flash від Ant Group добре ілюструє цей зсув. Вона має 124 млрд загальних параметрів, але активує приблизно 5,1 млрд параметрів на токен. Розробник позиціонує її як гібридну reasoning-модель для частих завдань із нативним контекстом у 256 тис. токенів, який можна розширити до 1 млн.
Ling-3.0-flash використовує архітектуру Mixture-of-Experts (MoE), або «суміш експертів». Замість того щоб залучати всі параметри для обробки кожного токена, модель маршрутизує запит лише до невеликої підмножини спеціалізованих компонентів.
У цьому й полягає її економічна логіка: модель зберігає великий запас знань у всіх параметрах, проте під час генерації використовує значно менший активний обсяг. Відтак швидкість і собівартість обслуговування залежать передусім від обчислень, потрібних для конкретного токена, а не лише від повного розміру ваг моделі.
За даними Ant, Ling-3.0-flash становить близько 12,4% від загальної кількості параметрів і 8,1% від активних параметрів їхньої 1T-класної моделі Ring-2.6-1T. У релізі також описано гібридну архітектуру лінійної уваги, де чергуються шари KDA та MLA, разом із розрідженою MoE-маршрутизацією.
Це не означає, що загальна кількість параметрів перестала мати значення. Вона все ще впливає на те, що модель здатна представити й запам’ятати, а якість маршрутизації визначає, чи реалізує MoE свій потенціал. Але розріджена активація суттєво змінює економіку використання.
Ant заявляє, що Ling-3.0-flash дорівнює або перевершує Ring-2.6-1T у більшості опублікованих нею порівнянь. У дописі акаунта Ant Ling це сформульовано як відповідність або перевага над 1T-флагманом за більшістю тестів за використання приблизно однієї восьмої загальної кількості та однієї дванадцятої активних параметрів.
Це важливе внутрішнє порівняння, особливо з огляду на орієнтацію моделі на промислові агентні навантаження. Водночас воно не доводить, що Ling-3.0-flash краща за будь-яку більшу універсальну модель у кожній задачі.
На це є кілька причин:
Тому найкорисніша перевірка для команди — не абстрактний рейтинг, а тест на власному навантаженні: реальних схемах інструментів, кодовій базі, обмеженнях затримки, повторних спробах і вартості помилки.
У картці моделі згадано оцінювання SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas і SkillsBench. Також наведено роботу з агентними середовищами Claude Code, Kilo Code, Qwen Code, Hermes Agent та OpenClaw. 1
Таке позиціювання логічне. Агентний сценарій може спожити у рази більше токенів, ніж одна відповідь у чаті: модель читає файли, викликає API чи інші інструменти, аналізує їхні відповіді, коригує план і повторює цикл. У такому середовищі недорога модель, яка стабільно виконує типові кроки, може бути ціннішою за дорожчу універсальну модель, запущену на кожному етапі.
Практичний підхід може бути багаторівневим:
Ant документує нативне вікно контексту на 256 тис. токенів із можливістю розширення до 1 млн токенів. Це може бути корисним для великих кодових баз, довгих журналів викликів інструментів або збереження робочого стану.
OpenRouter для моделі вказує доступний контекст у 262 144 токени. 6
Однак сам по собі довгий контекст не є доказом кращої роботи в мультиагентних системах. Надійність таких систем залежить також від оркестрації, проєктування пам’яті, прав доступу до інструментів, передачі завдань між агентами та оцінювання результатів. Доступні джерела підтверджують довгий контекст і агентне позиціювання Ling-3.0-flash, але не дають кількісного підтвердження її переваги над конкурентами в мультиагентних розгортаннях.
Ling-3.0-flash представили 24 липня 2026 року. За повідомленням Ant, на OpenRouter і платформі компанії був доступний тимчасовий безплатний API-доступ до 3 серпня. Модель також доступна на Hugging Face, де проєкт акцентує на бенчмарках і агентних фреймворках. 1
На OpenRouter заявлена ціна становить $0,021 за мільйон вхідних токенів та $0,063 за мільйон вихідних токенів. 6 За таких тарифів тестувати модель на великих потоках запитів значно простіше, хоча фактичні витрати, затримка, доступність і якість можуть відрізнятися залежно від провайдера та умов розгортання.
OpenRouter також наводить окремі перцентилі: 49 для загального інтелекту, 56 для кодування та 54 для агентних задач. Це ще раз показує, чому один загальний рейтинг не дає повної відповіді для моделі, створеної насамперед як інструмент виконання. 12
Реліз відбувся того ж дня, коли Дженсен Хуанг опублікував свій перший допис у X. Він поділився листом на підтримку відкритих моделей, стверджуючи, що вони посилюють безпеку й кіберзахист, прискорюють інновації та поширення технологій, а також підтримують технологічний суверенітет поряд із закритими передовими моделями.
Цей збіг зробив Ling-3.0-flash показовим прикладом дискусії про відкриті ваги: коли ваги доступні, розробники можуть безпосередніше перевіряти, хостити, налаштовувати та інтегрувати модель. Але він не свідчить про партнерство або технічний зв’язок між Nvidia й Ant Group.
Найсильніший аргумент Ling-3.0-flash — не в тому, що великі моделі більше не потрібні. Її приклад підтримує іншу стратегію: розподіляти моделі за ролями та оцінювати їх за вартістю якісного виконання завдання.
Розріджена MoE-модель може поєднати широкий запас параметрів із набагато меншою активацією на токен. Для частих циклів агентів це потенційно означає нижчу вартість і вищу швидкість без переходу до надто малої моделі з обмеженими можливостями.
Заяви про продуктивність потребують незалежного відтворення, а Ling-3.0-flash не варто вважати універсальною заміною найбільшим системам загального призначення. Проте її характеристики, акцент на агентних задачах, довгий контекст і низька заявлена ціна API дають вагомі підстави протестувати подібні спеціалізовані MoE-моделі там, де інференсні витрати та затримка є критичними. 1
6
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Ling 3.0 flash має 124 млрд загальних параметрів, проте для кожного токена задіює приблизно 5,1 млрд — це основа її потенційної економічності.
Ling 3.0 flash має 124 млрд загальних параметрів, проте для кожного токена задіює приблизно 5,1 млрд — це основа її потенційної економічності. Модель орієнтована на часті задачі: програмування, виклики інструментів, пошук, форматування та багатоетапні агентні процеси.
Власні тести Ant Group виглядають сильними, але для вибору моделі командам варто перевіряти її на власних репозиторіях, інструментах і сценаріях помилок.