Ling 3.0 flash VL — открытая модель inclusionAI/Ant Group по лицензии MIT: она принимает текст, изображения и видео, а отвечает текстом. В разреженной MoE архитектуре хранится 124 млрд параметров, но на каждый токен активируется примерно 5,5 млрд — это снижает вычисления по сравнению с плотной моделью такого же обще...
ОпубликовалОтредактировано с помощью GPT-5.6 TerraИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Ant Group and inclusionAI’s open-source Ling-3.0-flash-VL, released on September 9, 2026, and how do its 124-billion-parameter mixtu. Article summary: Ling-3.0-flash-VL is inclusionAI/Ant Group’s MIT-licensed, open-weight vision-language extension of the Ling-3.0-flash reasoning model. Its main distinction is that vision is intended to participate in an agentic feedbac. Topic tags: general, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ling-3.0-flash-VL — модель «зрение + язык» с открытыми весами от inclusionAI, подразделения Ant Group. Она построена на семействе рассуждающих моделей Ling-3.0-flash и использует разреженную архитектуру mixture-of-experts (MoE): всего в ней 124 млрд параметров, но при обработке одного токена задействуется около 5,5 млрд. Идея в том, чтобы сохранить большую общую ёмкость модели, не оплачивая вычисления всех 124 млрд параметров на каждом шаге генерации. 3
12
Но ключевая ставка Ant Group — не просто на добавление поддержки изображений. Ling-3.0-flash-VL позиционируется как основа для визуальных агентов: система должна рассмотреть экран, документ или веб-страницу, выполнить действие с помощью внешнего инструмента, увидеть обновлённое состояние и проверить, достигнут ли результат. Этот цикл компания называет визуальной обратной связью. 12
Ling-3.0-flash-VL принимает текст, изображения и видео, а выдаёт текст. Заявленный размер контекстного окна — до 256K токенов. Такой запас контекста нужен для длинных документов, продолжительных мультимодальных диалогов и агентных задач, где важно сохранять историю действий. 3
4
В описаниях модели упоминается гибридная архитектура с Kimi Delta Attention и слоями gated multi-head latent attention. Для видеоданных применяется позиционное кодирование VideoRoPE, предназначенное для учёта временной последовательности кадров. 1
6
Практический смысл этого подхода в том, что визуальные данные, по заявлению разработчиков, участвуют в цепочке рассуждений, а не служат лишь дополнительным вложением к текстовому запросу. Именно это лежит в основе формулировки «нативная мультимодальность». 1
12
В MoE-модели есть множество специализированных блоков — «экспертов». Механизм маршрутизации выбирает лишь часть из них для конкретного токена. Для Ling-3.0-flash-VL сообщается о 124 млрд параметров всего и примерно 5,5 млрд активных параметров на токен. 3
12
Разница принципиальна:
Это не делает запуск модели простым: хранение открытых весов такого масштаба всё равно требует много памяти и аккуратной инженерной настройки. Однако именно этим объясняется обозначение flash: модель пытается сочетать крупную базу параметров с более умеренной стоимостью вычислений на токен, чем у плотной 124-миллиардной модели. 3
5
Обычная vision-language модель может описать фото, извлечь текст из чека или ответить на вопрос по диаграмме. Ling-3.0-flash-VL ориентирована на более длинный цикл:
Это особенно важно для автоматизации графических интерфейсов. Например, модель может оценить текущее состояние формы на экране, выбрать действие, посмотреть на обновившийся интерфейс и решить, завершена ли задача.
При этом сама модель не заменяет браузер, систему разрешений, инструменты автоматизации и защитные ограничения. Именно внешняя среда определяет, какие действия агент реально может выполнить.
Ant Group и профильные публикации называют среди предполагаемых сценариев генерацию фронтенда, GUI-автоматизацию и интерпретацию медицинских отчётов. 12 Последний сценарий следует понимать как вспомогательную работу с документами, а не как доказательство автономной клинической надёжности или безопасности модели.
Веса выпущены по лицензии MIT; сообщалось о вариантах BF16 и FP8. Версии FP4 и INT4 в ранних публикациях назывались планируемыми или готовящимися к выходу. 3
4
Для запуска упоминаются SGLang и адаптированный для Ling путь на vLLM. 3
4 Для промышленного использования это стоит считать отправной точкой, а не гарантией совместимости: необходимо тестировать конкретную ревизию модели, тип квантования, обработку мультимодальных входных данных, длину контекста, оборудование и версию фреймворка.
В публикациях фигурируют два значения Artificial Analysis Intelligence Index:
Эти результаты не обязательно противоречат друг другу: менялась версия самого индекса. Но сравнивать 42 и 25 так, словно это баллы одной и той же шкалы, нельзя. Более осторожный вывод таков: по опубликованным данным модель выглядит конкурентоспособной с точки зрения эффективности относительно числа активных параметров. Это само по себе не доказывает её надёжность в любом агентном, производственном или тем более клиническом процессе. 3
4
Значимость модели не сводится к поддержке картинок и видео. Ling-3.0-flash-VL представлена как первая открытая модель линейки Ling, в которой зрительные данные включены в повторяющийся процесс планирования, действия, визуальной проверки и исправления. Разреженная MoE-архитектура должна сделать такой мультимодальный агентный подход менее затратным по вычислениям, чем сопоставимая плотная модель. 3
12
Наиболее реалистичный сценарий для разработчиков — ограниченный процесс, где визуальные свидетельства критичны, а каждое действие инструмента можно проверить: сверить отрендеренную страницу с макетом, пройти по контролируемому интерфейсу или извлечь и перепроверить данные из нескольких документов. Демо и оценки, опубликованные разработчиком, выглядят обнадёживающе, но надёжное внедрение по-прежнему требует проверки на конкретной задаче, управления правами, обработки ошибок и участия человека.
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Ling 3.0 flash VL — открытая модель inclusionAI/Ant Group по лицензии MIT: она принимает текст, изображения и видео, а отвечает текстом.
Ling 3.0 flash VL — открытая модель inclusionAI/Ant Group по лицензии MIT: она принимает текст, изображения и видео, а отвечает текстом. В разреженной MoE архитектуре хранится 124 млрд параметров, но на каждый токен активируется примерно 5,5 млрд — это снижает вычисления по сравнению с плотной моделью такого же общего размера.
Главная заявленная особенность — визуальный контур обратной связи: модель должна наблюдать результат действия, сверять его с целью и при необходимости корректировать следующий шаг.