Qwen3.8 Omni Flash nimmt Text, Bilder, Audio und Video direkt entgegen und bietet ein Kontextfenster von bis zu einer Million Tokens. Alibaba meldet im Schnitt mehr als 25 Prozent bessere Ergebnisse als bei Qwen3.5 Omni Plus über 29 Tests; bei langen Videos soll gezieltes Sichten Tokens sparen.
Veröffentlicht vonBearbeitet mit GPT-6 SolBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8 Omni Flash, launched on the Qwen AI platform in September 2026, and how do its native text, image, audio, and vide. Article summary: Alibaba’s Qwen3.8 Omni Flash is a September 2026 model available on the Qwen AI platform that accepts text, images, audio, and video natively in one workflow, with a context window of up to 1 million tokens.. Topic tags: general web, agents, ai, workflow, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake
Alibaba hat Qwen3.8-Omni-Flash im September 2026 auf der Qwen-AI-Plattform verfügbar gemacht. Das Modell verarbeitet Text, Bilder, Audio und Video als Eingaben innerhalb eines Workflows. Sein Kontextfenster umfasst bis zu eine Million Tokens – Einheiten, in denen Modelle Eingaben verarbeiten. Die reguläre Modellvariante liefert Text als Ausgabe. 2
1
5
Der praktische Unterschied liegt nicht allein darin, dass das Modell eine Aufnahme beschreiben kann. Ein darauf aufbauender KI-Agent soll relevante Stellen finden, Informationen aus Bild und Ton zusammenführen, nächste Schritte planen und für die Erledigung einer Aufgabe Werkzeuge aufrufen können. Dafür müssen die verschiedenen Eingabearten nicht jeweils an ein separates Modell übergeben werden. 16
52
Statt ein langes Video durchgehend mit derselben Detailtiefe auszuwerten, kann ein Agent gezielt die für eine Frage wichtigen Passagen untersuchen. Alibaba berichtet für diesen selektiven Ansatz auf OmniVideoBench von 51,8 Prozent weniger Tokens als bei einer statischen Auswertung. Das ist ein Testergebnis, keine zugesicherte Einsparung für jedes Video. 16
Für Besprechungen unterstützt das Modell laut den bereitgestellten Angaben Audio-Video-Eingaben von bis zu einer Stunde. Es kann Sprache und Bild gemeinsam auswerten, Sprecher auseinanderhalten, Gesagtes transkribieren und Äußerungen Personen zuordnen. Zusammen mit Werkzeugaufrufen wird daraus ein Workflow, der beispielsweise Informationen für ein Protokoll und Aufgaben sammelt, statt nur eine allgemeine Zusammenfassung zu schreiben. 52
2
Alibaba meldet über 29 Auswertungen hinweg eine durchschnittliche Verbesserung von mehr als 25 Prozent gegenüber Qwen3.5-Omni-Plus. Auch diese Zahl beschreibt die vom Anbieter berichteten Tests, nicht die Leistung in jeder konkreten Anwendung. 12
Für die Umsetzung hat Qwen die offenen Qwen-MM-Plugins für längere Audio-Video-Workflows erweitert und mit Qwen-Live Harness eine separate Open-Source-Laufzeitumgebung für fortlaufende Live-Interaktion veröffentlicht. Die Variante Qwen3.8-Omni-Flash-Realtime verarbeitet Live-Audio und -Video, kann Text und Audio ausgeben und unterstützt unter anderem mehrkanaliges Audio, Video-Aggregation und entfernte MCP-Werkzeuge. MCP ist ein Protokoll, über das KI-Anwendungen externe Werkzeuge anbinden können. Die offenen Hilfsprogramme sind dabei nicht mit offen veröffentlichten Modellgewichten gleichzusetzen. 52
1
5
Laut Alibaba sind die API-Eingabekosten pro Stunde gegenüber dem Vorgängermodell für Audio um mehr als 98 Prozent und für kombiniertes Audio und Video um mehr als 93 Prozent gesunken. Mit der gezielten Videoauswertung könnte das wiederholte Sichten von Medien in produktiven Agenten-Systemen damit günstiger werden. Die tatsächliche Rechnung hängt jedoch weiterhin davon ab, wie viel Material verarbeitet wird, wie viele Tokens anfallen und welche Ausgaben und Werkzeuge der Workflow benötigt. 12
16
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Qwen3.8 Omni Flash nimmt Text, Bilder, Audio und Video direkt entgegen und bietet ein Kontextfenster von bis zu einer Million Tokens.
Qwen3.8 Omni Flash nimmt Text, Bilder, Audio und Video direkt entgegen und bietet ein Kontextfenster von bis zu einer Million Tokens. Alibaba meldet im Schnitt mehr als 25 Prozent bessere Ergebnisse als bei Qwen3.5 Omni Plus über 29 Tests; bei langen Videos soll gezieltes Sichten Tokens sparen.
Plugins und eine separate Realtime Variante unterstützen Agenten Workflows. Laut Alibaba sind die API Eingabekosten pro Stunde für Audio um mehr als 98 Prozent und für Audio mit Video um mehr als 93 Prozent gesunken.