Ling 3.0 flash имеет 124 млрд параметров, однако для обработки каждого токена активирует примерно 5,1 млрд — это ключ к снижению вычислительных затрат в разреженной MoE архитектуре. Модель ориентирована на частые операции: программирование, вызов инструментов, работу с агентами и длинные рабочие цепочки; нативное ок...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: How did Ant Group Bailing’s July 30, 2026 release of the open-source Ling-3.0-flash execution model—coinciding with Jensen Huang’s first X p. Article summary: The release is evidence for a “sparse execution-model” strategy, not proof that parameter count has ceased to matter. Ling-3.0-flash concentrates computation on roughly 5.1B parameters per token while retaining 124B para. Topic tags: general, general web, user generated, documentation, education. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text,
Для команд, внедряющих ИИ в разработку и внутренние процессы, главный вопрос всё чаще звучит не так: «У какой модели больше параметров?» Гораздо практичнее спросить: какая модель даёт приемлемое качество при минимальных задержках и стоимости инференса?
Ling-3.0-flash от Ant Group — показательный пример такого сдвига. У модели 124 млрд параметров в сумме, но при генерации каждого токена она активирует приблизительно 5,1 млрд параметров. Разработчик позиционирует её как экономичную гибридную reasoning-модель для высокочастотных задач. Нативное контекстное окно — 256 тыс. токенов, с возможностью расширения до 1 млн токенов.
Ling-3.0-flash построена как Mixture of Experts (MoE) — «смесь экспертов». В такой архитектуре модель не прогоняет каждый токен через все свои параметры. Вместо этого механизм маршрутизации выбирает небольшую группу специализированных «экспертов».
Идея проста: модель сохраняет широкую обученную ёмкость, но её фактическая вычислительная нагрузка на один токен оказывается значительно меньше, чем у системы, которая использует весь массив параметров постоянно.
По данным Ant, общий размер Ling-3.0-flash составляет около 12,4% от размера её модели класса 1 трлн параметров Ring-2.6-1T, а активируемая часть — около 8,1%. В материалах о релизе также описана гибридная архитектура линейного внимания, чередующая слои KDA и MLA, вместе с разреженной MoE-маршрутизацией.
Это не означает, что общее число параметров перестало иметь значение. Оно всё ещё влияет на то, какие закономерности модель способна представить, а качество маршрутизации определяет, сможет ли MoE реализовать свой потенциал. Но для эксплуатации особенно важны параметры и вычисления внимания, реально используемые на каждом токене, — именно они ближе всего связаны со скоростью и себестоимостью ответа.
Ant заявляет, что Ling-3.0-flash сопоставима с Ring-2.6-1T или превосходит её в большинстве опубликованных сравнений. В посте аккаунта Ant Ling результат описывался как паритет или преимущество над 1T-флагманом при примерно одной восьмой общего числа параметров и одной двенадцатой активируемых параметров.
Это существенное внутреннее сравнение, тем более что модель прямо нацелена на производственные агентные нагрузки. Но из него не следует, что Ling-3.0-flash лучше любой более крупной универсальной модели в любой задаче.
Здесь важны три оговорки:
Поэтому тестировать модель стоит не на абстрактном вопросе в чате, а на репрезентативной нагрузке: с реальными схемами вызовов инструментов, контекстом кода, требованиями к задержке, повторными попытками и понятной ценой ошибки.
В карточке модели упоминаются оценки SWE-Bench Pro, SWE-Bench Multilingual, Tau3-banking-AA, MCP-Atlas и SkillsBench. Также заявлена работа в агентных средах, включая Claude Code, Kilo Code, Qwen Code, Hermes Agent и OpenClaw. 1
Это логичное направление. Агентный сценарий редко ограничивается одним ответом: система читает файлы, вызывает API или другие инструменты, получает результаты, корректирует план и при необходимости повторяет шаги. Объём токенов быстро становится намного больше, чем в обычном диалоге.
В таких условиях недорогая модель, стабильно исполняющая рутинные этапы, может оказаться полезнее более мощной и дорогой универсальной системы, используемой на каждом шаге. Практичная схема выглядит так:
Ant документирует нативное окно в 256 тыс. токенов, расширяемое до 1 млн. Это может быть полезно при работе с крупными кодовыми базами, длинными трассировками вызовов инструментов и сохраняемым рабочим состоянием.
На OpenRouter для модели указано обслуживаемое контекстное окно в 262 144 токена. 6
Однако большой контекст не следует путать с доказанным преимуществом в мультиагентных системах. Он помогает хранить больше общей информации в рамках процесса, но надёжность таких систем зависит также от оркестрации, устройства памяти, прав инструментов, передачи задач между агентами и качества оценки результата. Доступные источники подтверждают длинный контекст и агентное позиционирование модели, но не дают количественного доказательства её превосходства над конкурентами именно в мультиагентных развёртываниях.
Ling-3.0-flash была представлена 24 июля 2026 года. В релизном сообщении Ant говорилось о временном бесплатном доступе к API на OpenRouter и платформе Ant до 3 августа. Модель также доступна на Hugging Face, где проект акцентирует внимание на бенчмарках для кода и агентов. 1
На OpenRouter указана цена $0,021 за 1 млн входных токенов и $0,063 за 1 млн выходных токенов при контекстном окне 262 144 токена. 6 Такие ставки делают доступным тестирование на объёмных рабочих процессах, хотя фактические расходы, задержки, доступность и качество ответов зависят от провайдера и условий развёртывания.
В каталоге OpenRouter для Ling-3.0-flash приведены отдельные перцентили: 49 по общему интеллектуальному показателю, 56 по программированию и 54 по агентным задачам. 12 Это ещё раз показывает, почему один громкий общий рейтинг плохо описывает модель, заточенную под исполнение повторяющихся действий.
Релиз совпал с первым постом Дженсена Хуанга в X. Глава Nvidia опубликовал письмо в защиту открытых моделей, заявив, что они укрепляют безопасность и киберзащиту, ускоряют инновации и распространение технологий, а также поддерживают технологический суверенитет наряду с передовыми закрытыми системами.
Это совпадение сделало Ling-3.0-flash удобной иллюстрацией дискуссии об open-weight ИИ: доступные веса позволяют разработчикам глубже изучать, размещать у себя, дообучать и интегрировать модели. Но хронологическая близость двух событий не доказывает ни партнёрства, ни технической связи между Nvidia и Ant Group.
Ling-3.0-flash сильнее всего подтверждает стратегию модели исполнения с поправкой на стоимость. Разреженная MoE-архитектура способна сочетать широкую ёмкость хранимых весов с небольшой активацией на токен. Для частых агентных циклов это потенциально означает меньшую цену и более высокую скорость — без перехода к заведомо малой модели.
Заявления о производительности ещё нуждаются в независимом воспроизведении, и считать Ling-3.0-flash универсальной заменой крупнейшим моделям не стоит. Но её спецификации, фокус на коде и инструментах, длинный контекст и низкие заявленные API-тарифы дают вескую причину проверить такие специализированные разреженные модели там, где стоимость инференса и задержка действительно ограничивают продукт. 1
6
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Ling 3.0 flash имеет 124 млрд параметров, однако для обработки каждого токена активирует примерно 5,1 млрд — это ключ к снижению вычислительных затрат в разреженной MoE архитектуре.
Ling 3.0 flash имеет 124 млрд параметров, однако для обработки каждого токена активирует примерно 5,1 млрд — это ключ к снижению вычислительных затрат в разреженной MoE архитектуре. Модель ориентирована на частые операции: программирование, вызов инструментов, работу с агентами и длинные рабочие цепочки; нативное окно контекста составляет 256 тыс.
Заявления Ant о сопоставимости или превосходстве над 1T моделью относятся к собственным бенчмаркам компании.