Нативная мультимодальность делает зрение частью агентного цикла: Kimi K3 и Qwen3.8 Max могут планировать работу, создавать результат, визуально оценивать его и исправлять ошибки. Kimi K3 набрала 1 679 баллов и заняла первое место в Arena Frontend Code Arena; Qwen3.8 Max заявляет об использовании визуального понимани...
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Разница между передовыми моделями всё чаще состоит не в том, умеет ли система принять изображение на вход. Важнее другое: является ли визуальная информация полноценной частью рассуждений агента — или передаётся ему в виде отдельного текстового отчёта.
Moonshot AI позиционирует Kimi K3 как нативно мультимодальную агентную модель для длительных задач программирования, работы со знаниями, визуального понимания и рассуждений. Alibaba, в свою очередь, сообщает, что Qwen3.8-Max использует визуальное понимание на всех этапах — от планирования до исполнения и проверки. 17
35 Практический смысл прост: агент должен суметь создать интерфейс, увидеть отрисованный результат, обнаружить несоответствие и исправить его, не сводя каждое наблюдение со скриншота к промежуточному текстовому описанию.
Текстовые универсальные модели по-прежнему очень полезны для генерации кода, анализа больших контекстов, вызова инструментов и задач, где и входные данные, и критерии успеха уже выражены текстом. В типичной инструментальной схеме агент может вызвать OCR для распознавания текста, изучить DOM-дерево или дерево доступности, запросить координаты элементов либо передать скриншот отдельной vision-language-модели.
Такая архитектура бывает разумной, например при извлечении данных из документов, структурированной проверке интерфейса или единичном вопросе по изображению.
Нативное мультимодальное обучение делает другую ставку: совместно работать с текстом, изображениями, видео, кодом и состоянием агента, чтобы визуальные данные напрямую влияли на планирование и последующие правки. В обзорах китайского рынка моделей Moonshot, Alibaba и ByteDance описывались как компании, выбравшие этот путь, тогда как на тот момент универсальные релизы DeepSeek, Zhipu и Hunyuan были сравнительно ориентированы на текст. 15
Однако это не следует трактовать как неизменное разделение компаний на два лагеря. Изначально DeepSeek V4 Flash и V4 Pro поддерживали только текст, но позднее DeepSeek представила экспериментальную модель DeepSeek-V4-Flash-Vision-Exp. 13
4 Линейки моделей быстро меняются, а доступные источники не позволяют достоверно объяснить внутреннюю стратегию каждого разработчика — особенно ByteDance, Zhipu и Tencent.
Веб-страница — это не только текст и структура DOM. В ней важны визуальная иерархия, отступы, выравнивание, контраст, типографика, обрезанные элементы, изображения и взаимное расположение компонентов. Если агенту поручено повторить референсный дизайн, именно эти характеристики часто и являются фактическими критериями приёмки.
Рабочий цикл с визуальной обратной связью может выглядеть так:
Qwen3.8-Max прямо описывает такую замкнутую схему: нативное визуальное понимание задействовано при планировании, выполнении и проверке длительных задач. В облачной версии модели поддерживаются изображения, текст и видео на входе, а на выходе формируется текст. 35 Kimi K3 также понимает текст, изображения и видео в рамках одной модели и имеет контекстное окно в 1 млн токенов.
25
Преимущество не сводится к фразе «модель умеет видеть». Суть в том, что один агент способен удерживать в контексте задачу, код, визуальный результат и меняющийся план, пока итеративно улучшает работу.
Внешние инструменты восприятия нередко эффективны, но они создают границу между тем, как агент видит результат, и тем, как он действует.
OCR избирателен. Он извлекает видимые слова, но одного распознанного текста недостаточно, чтобы понять, обрезана ли кнопка, выглядит ли макет несбалансированным, перекрывает ли модальное окно контент или отличается ли визуальная иерархия от референса.
Координаты формальны, но узки. Сообщение вида «элемент находится в точке X/Y» полезно для автоматизации. Но из него может быть неясно, насколько элемент заметен, верно ли оформлен, перекрыт ли другим объектом или вообще соответствует нужному визуальному объекту.
Повторное преобразование данных усложняет длинные цепочки. В многошаговом процессе каждый переход от скриншота к описанию или координатам может терять контекст. Агенту приходится заново восстанавливать картину. Исправление, сделанное по неполному описанию, способно породить новый визуальный дефект — и потребовать ещё одного цикла наблюдения.
Нативно мультимодальная модель, конечно, не застрахована от ошибок. Но она может анализировать скриншот вместе с контекстом реализации, а не опираться только на текстовый пересказ изображения. Поэтому такой подход особенно привлекателен для фронтенд-разработки, автоматизации GUI, отладки визуальных регрессий, редактирования изображений и задач с видео.
Публичные результаты Kimi K3 помогают понять, почему разработчики обращают на это внимание. Arena сообщила, что Kimi K3 заняла первое место в Frontend Code Arena с результатом 1 679 баллов — это рост на 17 позиций по сравнению с Kimi K2.6. Модель стала первой в шести из семи указанных категорий фронтенд-задач. 32
Отдельно сообщалось о тесте платформы Puter: Kimi K3 нашла пять намеренно внесённых визуальных расхождений между целевой веб-страницей и её отрисованной версией, не дав ложных срабатываний. 28
Это убедительные демонстрации визуальной проверки, но они не доказывают, что результат был обеспечен исключительно нативным зрением. На качество влияют масштаб модели, обучающие данные, дообучение, формулировка запросов, браузерные инструменты, агентная обвязка и особенности самого бенчмарка. Более аккуратный вывод таков: визуальная обратная связь помогает закрыть реальный класс ошибок, которые могут не обнаружить текстовые тесты.
Нативно мультимодальный агент особенно уместен, когда задача требует многократного наблюдения и доработки, а визуальная точность — часть определения готового результата:
Модульная схема с OCR или внешней VLM всё ещё может быть лучшим выбором для недорогого извлечения данных, пакетной обработки или процессов, которым нужен только структурированный текст и состояние интерфейса. Главный вопрос не в том, модно ли «зрение» в ИИ. Он в другом: должен ли агент снова и снова отвечать на визуальный вопрос — действительно ли результат выглядит правильно?
Для таких задач нативная мультимодальность превращает восприятие из редкого вызова внешнего инструмента в элемент рабочего цикла агента. Именно это направление явно развивают Kimi K3 и Qwen3.8-Max. 17
35
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Нативная мультимодальность делает зрение частью агентного цикла: Kimi K3 и Qwen3.8 Max могут планировать работу, создавать результат, визуально оценивать его и исправлять ошибки.
Нативная мультимодальность делает зрение частью агентного цикла: Kimi K3 и Qwen3.8 Max могут планировать работу, создавать результат, визуально оценивать его и исправлять ошибки. Kimi K3 набрала 1 679 баллов и заняла первое место в Arena Frontend Code Arena; Qwen3.8 Max заявляет об использовании визуального понимания на этапах планирования, выполнения и проверки.