Qwen veröffentlichte Qwen3.8 Flash Next am 26. August 2026 als multimodales Open Weight Modell und frühen Einblick in die für Qwen4 geplante Architektur.
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Alibaba’s Qwen3.8-Flash—also released as Qwen3.8-Flash-Next—and why is it significant as an open multimodal mixture-of-experts techn. Article summary: Qwen3.8-Flash, released as the open-weight Qwen3.8-Flash-Next, is Alibaba Qwen’s multimodal mixture-of-experts (MoE) technical-preview model for the architecture intended to underpin Qwen4. It matters less as a conventio. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
Alibaba und sein KI-Team Qwen haben am 26. August 2026 Qwen3.8-Flash-Next veröffentlicht; weitere Berichte folgten am 27. August. Das Open-Weight-Modell ist ausdrücklich nicht das fertige Qwen4-Flaggschiff. Es dient vielmehr als früher, einsehbarer Vorgeschmack auf die Architektur, die künftig die Qwen4-Familie tragen soll. 1
2
15
Die zentrale Idee: Qwen3.8-Flash-Next verfügt über ein Hauptmodell mit 125 Milliarden Parametern sowie zusätzliche 51 Milliarden Parameter für N-Gramm-Embeddings. Pro verarbeitetem Token werden jedoch nur etwa 6 Milliarden Parameter aktiviert. Damit soll die hohe Gesamtkapazität eines großen Modells erhalten bleiben, ohne bei jedem Token den vollständigen Rechenaufwand eines dichten Modells zu bezahlen. 4
15
Der Name Qwen3.8-Flash-Next bezeichnet das veröffentlichte offene Modell. Qwen3.8-Flash steht dagegen für die produktionsorientierte Modell- und API-Variante. „Flash-Next“ kennzeichnet somit den offenen Architektur-Preview für Entwickler und Forschungsteams. Berichte beschreiben ihn als multimodales Mixture-of-Experts-Modell (MoE), das auf Technologien für Qwen4 basiert. 1
2
15
Diese Unterscheidung ist wichtig: Die Veröffentlichung belegt nicht, dass Qwen4 bereits erschienen ist. Sie gibt Entwicklern vielmehr die Möglichkeit, die neue Architektur früh zu untersuchen, Inferenz- und Serving-Werkzeuge anzupassen und Rückmeldungen zu liefern, bevor die komplette Qwen4-Familie auf den Markt kommt. 2
3
15
Die Angabe von 1 Million Tokens darf dabei nicht mit dem nativen Kontextlimit verwechselt werden. Die reguläre Konfiguration ist auf 262.144 Tokens ausgelegt; das größere Fenster hängt von der YaRN-Erweiterung ab und sollte als erweiterte Betriebsart betrachtet werden. 1
4
16
Qwen3.8-Flash-Next kombiniert Gated DeltaNet (GDN) mit Qwen Sparse Attention (QSA). GDN soll Informationen aus dem bisherigen Kontext komprimieren. QSA verwendet dagegen einen kompakten Index, um relevante Mikroblöcke auszuwählen, anstatt den gesamten bisherigen Verlauf gleichmäßig mit voller Aufmerksamkeit zu verarbeiten. 4
Das Ziel ist, die Kosten und Verzögerungen bei der Verarbeitung sehr langer Sequenzen zu begrenzen. Qwen berichtet bei Sequenzen mit 1 Million Tokens von bis zu 7,6-fach schnellerem Prefill und bis zu 4,9-fach schnellerem Decoding. Diese Werte stammen vom Anbieter und hängen unter anderem von Hardware, Implementierung, Sequenzlänge und Benchmark-Setup ab. Sie sind daher nicht automatisch auf jede produktive Umgebung übertragbar. 4
Das separate N-Gramm-Embedding-Modul soll die Darstellungskapazität erweitern, ohne dass bei jedem Token der gesamte zusätzliche Parameterbestand aktiv berechnet werden muss. Qwens Design unterstützt außerdem die Auslagerung dieser Embedding-Tabelle in den Hauptspeicher. Daten können asynchron vorab geladen werden, während gleichzeitig die eigentliche Modellberechnung läuft. 4
Für Betreiber großer Modelle ist das ein praktischer Ansatz: Nicht nur die Zahl der Parameter, sondern auch deren Speicherort und die Bewegung der Daten beeinflussen die tatsächlichen Kosten. Das gilt besonders bei langen Dokumenten und umfangreichen Batch-Verarbeitungen.
Der Preview umfasst zudem Änderungen an Optimierung und Skalierung. Qwen nennt den Muon-Optimierer, Anpassungen an dessen Zusammenspiel mit AdamW und der Parameterbehandlung sowie ein neu angepasstes Skalierungsgesetz für diese Modellarchitektur. 4
Damit handelt es sich nicht lediglich um einen bekannten Checkpoint mit einem anderen Aufmerksamkeitsblock. Die Veröffentlichung ist ein öffentlicher Test eines umfassenderen Bauplans: hohe Gesamtkapazität bei vergleichsweise geringer aktiver Rechenlast.
Qwen zufolge benötigte das Training von Qwen3.8-Flash ungefähr ein Neuntel der Kosten von Qwen3.7-Plus und verbesserte zugleich die Ergebnisse bei Programmier- und Büroaufgaben. Reuters berichtete unabhängig über die Unternehmensangaben zu höherer Coding- und Office-Leistung bei niedrigeren Trainingskosten. 1
4
In der Berichterstattung werden unter anderem folgende Werte genannt: 58,7 Punkte bei DeepSWE 1.1, 62,5 bei SWE-bench Pro und 84,5 bei AndroidWorld. Qwen ordnet diese Ergebnisse vor DeepSeek V4 Flash im Value-Segment ein. Die Vergleiche stammen jedoch aus Unternehmensangaben; das vorliegende Material belegt keine unabhängige Reproduktion unter vollständig identischen Testbedingungen. 4
Für die produktionsorientierte Variante Qwen3.8-Flash nennt das Release-Material einen API-Preis von 1 Yuan pro 1 Million Eingabe-Tokens und 3 Yuan pro 1 Million Ausgabe-Tokens. Eine Unterscheidung zwischen Haupt- und Nebenzeiten wird darin nicht beschrieben. Preisvergleiche mit anderen Modellen bleiben abhängig von Modellversion, Caching, Kontextlänge, Servicestufe und benötigter Ausgabequalität. 1
4
Die offenen Gewichte machen Qwen3.8-Flash-Next zu einer Experimentierplattform, noch bevor Qwen4 vollständig erscheint. Entwickler können Inferenz-Tools anpassen, Quantisierung und Bereitstellung testen und prüfen, wie sich das Modell in den eigenen Arbeitsabläufen verhält. 2
3
15
Besonders naheliegend sind Anwendungen, bei denen Kontextlänge oder Tokenkosten eine entscheidende Rolle spielen:
Diese Einsatzfelder ergeben sich aus dem veröffentlichten Langkontext- und Aktivierungsdesign. Sie sind jedoch keine Garantie dafür, dass Qwen3.8-Flash-Next in jeder Produktionsumgebung ein dichtes oder vollständig aufmerksames Alternativmodell übertrifft. Hardware, Serving-Software, Quantisierungsqualität, Retrieval-Strategie und die konkrete Zusammensetzung der Arbeitslast bleiben entscheidend.
Die Bedeutung von Qwen3.8-Flash-Next liegt vor allem darin, dass Qwen seine architektonische Richtung ungewöhnlich früh öffentlich macht. Forschende und Entwickler können untersuchen, ob komprimierte und sparsame Aufmerksamkeit, große zusätzliche Embeddings und wenige aktive Parameter tatsächlich eine bessere Langkontext-Ökonomie ermöglichen, ohne die Qualität zu stark zu beeinträchtigen.
Die stärksten Zahlen der Veröffentlichung – darunter Geschwindigkeitsgewinne, Benchmark-Vorsprünge, niedrigere Trainingskosten und Aussagen zur Wettbewerbsfähigkeit – stammen allerdings überwiegend von Qwen oder aus Berichten, die sich auf Qwen-Angaben stützen. Unabhängige Tests über verschiedene Hardware, Sprachen, Kontextlängen, multimodale Aufgaben und produktive Agenten-Workflows stehen noch aus.
Die belastbarste Einordnung fällt deshalb etwas nüchterner aus als die Aussage, Qwen3.8-Flash-Next schlage jedes Konkurrenzmodell: Es handelt sich um einen offenen, multimodalen MoE-Preview und um einen ungewöhnlich frühen Einblick in die Systemarchitektur, die Alibaba für Qwen4 vorbereitet. Zugleich liefert das Modell der Entwicklergemeinschaft einen konkreten, überprüfbaren Bauplan für effizientere KI mit sehr langen Kontexten.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Qwen veröffentlichte Qwen3.8 Flash Next am 26. August 2026 als multimodales Open Weight Modell und frühen Einblick in die für Qwen4 geplante Architektur.
Qwen veröffentlichte Qwen3.8 Flash Next am 26. August 2026 als multimodales Open Weight Modell und frühen Einblick in die für Qwen4 geplante Architektur. Das Modell kombiniert ein Hauptnetz mit 125 Milliarden Parametern und zusätzliche 51 Milliarden N Gramm Embeddings, aktiviert pro Token aber nur etwa 6 Milliarden Parameter.
Der native Kontext umfasst 262.144 Tokens und kann mit YaRN auf bis zu 1 Million Tokens erweitert werden; die genannten Geschwindigkeits und Benchmarkwerte stammen überwiegend von Qwen und müssen unabhängig überprüft...