Qwen3.8 Omni Flash, представлена у вересні 2026 року, приймає текст, зображення, аудіо й відео в межах одного робочого процесу; контекстне вікно сягає мільйона токенів. За даними Alibaba, середній результат моделі більш ніж на 25% вищий за Qwen3.5 Omni Plus у 29 оцінюваннях.
ОпублікувавВідредаговано за допомогою GPT-6 SolЗображення створено за допомогою GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Уявіть запис годинної зустрічі: потрібно не просто отримати розшифрування, а знайти рішення, пов’язати репліки з учасниками й підготувати підсумок. Саме для таких завдань Alibaba представила у вересні 2026 року Qwen3.8-Omni-Flash, доступну на платформі Qwen AI. Модель нативно приймає текст, зображення, аудіо та відео в одному процесі й має контекстне вікно до 1 млн токенів — одиниць, якими вимірюють обсяг інформації, доступної моделі під час роботи. Базова версія повертає текстову відповідь. 2
1
5
Ідея моделі полягає в тому, щоб зіставляти побачене й почуте, визначати наступний крок, за потреби використовувати інструменти та формувати результат. Це відрізняється від сценарію, у якому ШІ лише описує кадр або розшифровує мовлення. Для агентних процесів — коли система виконує послідовність дій задля поставленої мети — текст, звук і відео можуть бути частинами одного завдання. 16
52
На довгих відео такий підхід передбачає вибірковий перегляд: агент шукає моменти, потрібні для відповіді, замість того щоб однаково докладно обробляти кожен кадр. Alibaba повідомляє про використання на 51,8% меншої кількості токенів порівняно зі статичним аналізом у тесті OmniVideoBench. Це результат конкретного оцінювання, а не обіцянка такої самої економії для кожного відео. 16
Qwen3.8-Omni-Flash підтримує аудіовідеозаписи зустрічей тривалістю до години. Модель може спільно аналізувати зображення людей та їхнє мовлення, розділяти репліки за учасниками, транскрибувати розмову й співвідносити голоси з людьми в кадрі. Велике контекстне вікно також допомагає працювати з тривалими записами та супровідними матеріалами в межах одного процесу. 52
2
6
У порівнянні з Qwen3.5-Omni-Plus Alibaba заявляє середнє поліпшення більш ніж на 25% у 29 оцінюваннях. Це показник із набору тестів компанії: він не означає, що кожне окреме завдання стане швидшим або точнішим саме на стільки. 12
Розширений набір Qwen-MM-Plugins має допомагати агентним системам працювати з довгими аудіо- й відеоматеріалами, викликати інструменти та виконувати багатокрокові процеси. Окремо випущений відкритий Qwen-Live Harness призначений для безперервної взаємодії в реальному часі. Відкритість цих допоміжних інструментів не означає відкритості ваг самої моделі: Qwen3.8-Omni-Flash надається через API. 52
9
5
Для живих сценаріїв існує окрема версія Qwen3.8-Omni-Flash-Realtime. Вона підтримує взаємодію через аудіо та відео в реальному часі, відповіді текстом і звуком, багатоканальне аудіо, агрегування відео та віддалені інструменти MCP — протоколу підключення зовнішніх інструментів до ШІ-систем. Ці можливості Realtime не слід плутати з текстовою відповіддю базової моделі. 1
5
За заявою Alibaba, вартість API за годину аудіовходу знизилася більш ніж на 98%, а за годину спільного аудіо- та відеовходу — більш ніж на 93%. Разом із вибірковим аналізом відео це може зробити регулярне використання таких агентів економічно доступнішим. Проте фактичні витрати залежатимуть від обсягу медіа, кількості токенів, відповідей моделі та задіяних інструментів; заявлені відсотки не є знижкою на весь виробничий процес. 12
16
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Qwen3.8 Omni Flash, представлена у вересні 2026 року, приймає текст, зображення, аудіо й відео в межах одного робочого процесу; контекстне вікно сягає мільйона токенів.
Qwen3.8 Omni Flash, представлена у вересні 2026 року, приймає текст, зображення, аудіо й відео в межах одного робочого процесу; контекстне вікно сягає мільйона токенів. За даними Alibaba, середній результат моделі більш ніж на 25% вищий за Qwen3.5 Omni Plus у 29 оцінюваннях.
Окремі інструменти підтримують тривалі та інтерактивні сценарії, а Alibaba заявляє про зниження вартості API за годину аудіовходу більш ніж на 98% і аудіовідеовходу — більш ніж на 93%.