Qwen3.8 Omni Flash принимает текст, изображения, аудио и видео в едином процессе; объём контекста достигает 1 млн токенов. По данным Alibaba, средний результат модели вырос более чем на 25% относительно Qwen3.5 Omni Plus в 29 оценках.
ОпубликовалОтредактировано с помощью GPT-6 SolИзображения созданы с помощью GPT Image 2
Ответ на исследование

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Представьте задачу: найти в часовой записи встречи, кто взялся за проект, сверить речь с происходящим в кадре и подготовить итог. Для такого сценария Alibaba в сентябре 2026 года представила Qwen3.8-Omni-Flash, доступную на платформе Qwen AI. Модель принимает текст, изображения, аудио и видео как исходные данные в одном процессе, а её контекстное окно рассчитано на объём до 1 млн токенов. Обычная версия возвращает текстовый результат. 2
5
52
Замысел Qwen — дать ИИ-агенту возможность совместно анализировать увиденное и услышанное, определять дальнейшие действия и обращаться к инструментам. На длинном видео агент может искать нужные эпизоды выборочно, а не обрабатывать каждый кадр подряд. Alibaba сообщает, что в тесте OmniVideoBench такой подход потребовал на 51,8% меньше токенов, чем статический анализ; это результат испытания, а не обещание такой же экономии в любом приложении. 16
12
Для встреч модель поддерживает аудиовидеовход длительностью до часа и может сопоставлять участников в кадре с их репликами, разделять речь по выступающим и делать расшифровку. Большое контекстное окно помогает работать с продолжительными записями и сопутствующими материалами, а вызов инструментов — использовать найденное для дальнейших действий, а не ограничиваться описанием записи. 52
1
6
16
Alibaba также заявляет о росте среднего результата более чем на 25% по сравнению с Qwen3.5-Omni-Plus в 29 оценках. Эти цифры характеризуют выбранные тесты и сами по себе не показывают, насколько надёжно модель справится с каждой рабочей задачей. 12
Расширенный набор открытых Qwen-MM-Plugins помогает подключать работу с аудио и видео к агентным системам, в том числе для длительных процессов. Отдельно опубликован открытый Qwen-Live Harness для непрерывного взаимодействия в реальном времени. Это инструменты вокруг модели: саму Qwen3.8-Omni-Flash предлагают как сервис через API, без опубликованных весов. 1
52
5
Вариант Qwen3.8-Omni-Flash-Realtime принимает живые аудио- и видеопотоки и выдаёт текстовый и звуковой ответ. В его возможностях также указаны многоканальный звук, объединение видеоданных и удалённые инструменты MCP — протокола подключения внешних инструментов. 1
По расчётам Alibaba, стоимость API за час входящего аудио снизилась более чем на 98%, а за час входящего аудио и видео — более чем на 93%. Вместе с выборочным анализом записи это делает многократное обращение агента к медиаданным экономически доступнее. Но бюджет реального сервиса всё равно зависит от объёма обработанных материалов, числа токенов, длины ответов и используемых инструментов. 12
16
Studio Global AI
На этой странице есть ответ, подтвержденный источником, который вы можете продолжить внутри Studio Global.
Qwen3.8 Omni Flash принимает текст, изображения, аудио и видео в едином процессе; объём контекста достигает 1 млн токенов.
Qwen3.8 Omni Flash принимает текст, изображения, аудио и видео в едином процессе; объём контекста достигает 1 млн токенов. По данным Alibaba, средний результат модели вырос более чем на 25% относительно Qwen3.5 Omni Plus в 29 оценках.
Выборочный просмотр длинного видео и снижение цены аудио и аудиовидеовхода могут удешевить работу агентов, но итоговые затраты зависят от конкретной задачи.