Z.ai bestätigte am 26. August 2026, dass das anonyme Gratismodell Ox Alpha GLM 5.3 Flash war – ein Mixture of Experts Modell mit 320 Milliarden Parametern, davon 18 Milliarden pro Token aktiv, und MIT lizenzierten Gew...
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Am 26. August 2026 endete das Rätsel: Z.ai bestätigte, dass Ox Alpha – das anonym über OpenRouter und OpenCode angebotene Modell – GLM-5.3-Flash war. Z.ai bezeichnet es als erstes nativ multimodales Modell der GLM-5-Familie. Es kommt mit offenen Gewichten, einem Kontextfenster von rund einer Million Tokens und einer Ausrichtung auf Programmierung sowie lang laufende Agentenaufgaben. 15
40
Die wichtigere Geschichte ist jedoch größer als die Identität des Modells. Ox Alpha verband eine kostenlose, anonyme Vorschau mit einer Nutzung durch viele Entwickler und wurde anschließend zu einem benannten und herunterladbaren Produkt. Damit konnte Z.ai seine Infrastruktur unter realen Bedingungen testen und zugleich Aufmerksamkeit für den späteren Launch aufbauen.
GLM-5.3-Flash ist ein Mixture-of-Experts-Modell mit 320 Milliarden Gesamtparametern und 18 Milliarden aktiven Parametern pro Token. Es nimmt nativ Text, Bilder und Videos entgegen und erzeugt Text als Ausgabe. Die angegebene Kontextkapazität liegt bei etwa einer Million Tokens. Je nach Plattform wird die Grenze allerdings etwas anders dargestellt: Z.ais Dokumentation beschreibt das Design mit einer Million Tokens, während OpenRouter ein Kontextfenster von 1.310.720 Tokens ausweist. 1
2
3
40
Z.ai veröffentlichte die Gewichte unter der MIT-Lizenz. Dadurch lässt sich das Modell deutlich flexibler einsetzen als ein ausschließlich über eine geschlossene API verfügbares System. Nach dem Ende der anonymen Vorschau wurde es auf OpenRouter auch unter seinem öffentlichen Namen gelistet. 3
4
8
Wichtig ist die Abgrenzung zum größeren Modell GLM-5.3, das Anfang August angekündigt wurde. Berichten zufolge handelt es sich bei GLM-5.3-Flash um ein eigenständiges, kostengünstigeres 320B-A18B-Modell – nicht um dieselbe Produktvariante wie die größere GLM-5.3-Linie. 10
Z.ai zufolge verbessert GLM-5.3-Flash die Leistung von GLM-5.2 und senkt zugleich die Betriebskosten. In den zum Start genannten Ergebnissen erreichte das Modell 63,4 Punkte bei DeepSWE v1.1, gegenüber 46,2 Punkten für GLM-5.2. Außerdem meldete Z.ai 29,0 Punkte auf einem internen Coding-Benchmark – nahezu so viel wie die 29,5 Punkte, die für Claude Opus 4.8 genannt wurden. 3
16
Diese Zahlen zeigen, wie Z.ai das Modell positioniert, sind aber keine unabhängige Bestätigung einer Gleichwertigkeit mit dem Modell von Anthropic. Entscheidend sind unter anderem Benchmark-Definitionen, Testbedingungen, Prompts und die Möglichkeit, die Ergebnisse zu reproduzieren. Die vorsichtigste Schlussfolgerung lautet daher: Z.ai beansprucht starke Leistungen bei Programmierung und Agentenaufgaben zu deutlich niedrigeren Kosten. Ein eindeutiger Sieg über geschlossene Spitzenmodelle ist damit nicht belegt.
Das auffälligste Merkmal von Ox Alpha war zunächst der kostenlose Zugang während der anonymen Vorschau. Diese Phase endete, als das Modell seinen öffentlichen Namen erhielt. Z.ais angegebener Listenpreis beträgt 0,15 US-Dollar pro Million Eingabe-Tokens und 0,50 US-Dollar pro Million Ausgabe-Tokens. 1
3
OpenRouter zeigte rund um den Start einen niedrigeren Einführungspreis von 0,075 US-Dollar pro Million Eingabe-Tokens und 0,25 US-Dollar pro Million Ausgabe-Tokens. 2 Die Unterscheidung ist wichtig: Gratisvorschau, Listenpreis von Z.ai und ein zeitlich oder plattformbezogener Einführungsrabatt sind drei verschiedene Zugangsbedingungen.
Selbst zum Listenpreis bleibt die Kostenstruktur ein zentraler Teil des Angebots. Coding-Agenten können große Mengen an Kontext und Ausgaben verbrauchen. Deshalb kann ein niedriger Tokenpreis die Modellwahl ebenso stark beeinflussen wie ein kleiner Vorsprung in einem Benchmark.
Z.ai erklärte, GLM-5.3-Flash laufe vollständig auf in China gefertigten KI-Beschleunigern. 15 Berichte über das Serving-System beschreiben einen angepassten Stack auf Basis von SGLang. Zum Einsatz kommen demnach unter anderem Quantisierung, Tensor-Parallelismus, gemischte Cache-Formate, Layer-Splitting sowie eine getrennte Encode-, Prefill- und Decode-Architektur. Ziel sei eine bessere Leistung im gesamten Bereitstellungsprozess unter den Bedingungen heimischer Hardware.
25
Damit setzt Z.ai eine frühere Erzählung rund um die GLM-Familie fort. Das Unternehmen erklärte bereits, die Modelle auf Huawei-Ascend-Prozessoren trainiert zu haben – ohne Nvidia-Hardware. Berichten zufolge schränkt die Aufnahme von Z.ai auf die US-amerikanische Entity List den Zugang zu Nvidias Beschleunigern H100, H200 und B200 ein. 26
Die Behauptung zur Inferenz ist strategisch bedeutsam, sollte aber als Aussage des Unternehmens beziehungsweise als Branchenbericht verstanden werden – nicht als vollständig geprüfter Hardwarevergleich. Belastbarer ist die Feststellung, dass Z.ai seinen Modell-Stack als fähig präsentiert, ein großes multimodales Modell bereitzustellen, ohne auf Nvidias führende Rechenzentrums-GPUs angewiesen zu sein.
Die anonyme Veröffentlichung wirkt wie ein bewusstes Stealth-Launch-Modell: ein leistungsfähiges Modell zunächst ohne Zuordnung veröffentlichen, es über beliebte Coding-Zugänge kostenlos anbieten, die Nutzung durch Entwickler beobachten und das Produkt erst danach enthüllen. Z.ai wurde bereits mit einem früheren Test namens „Pony Alpha“ in Verbindung gebracht, der einem ähnlichen Muster gefolgt sein soll. Community-Forscher versuchten unterdessen, Ox Alpha anhand von Tokenizer-Verhalten, Hinweisen bei der Videoverarbeitung und API-Fehlermustern zu identifizieren. 7
11
13
Einige Berichte zum Launch nannten außerdem ungewöhnlich hohe Nutzungszahlen und große Begeisterung in der Entwicklergemeinschaft. Nicht jede dieser Zahlen oder jedes Zitat lässt sich anhand des verfügbaren Materials unabhängig bestätigen. Sie sollten daher als Berichte aus der Startphase und nicht als geprüfte Adoptionsdaten verstanden werden. 14
GLM-5.3-Flash beweist nicht, dass Z.ai OpenAI oder Anthropic über das gesamte Spektrum moderner Spitzenmodelle überholt hat. Die Veröffentlichung zeigt aber eine disruptive Kombination: multimodale Eingaben, sehr langen Kontext, offene Gewichte unter MIT-Lizenz, eine Spezialisierung auf Coding-Agenten und niedrige API-Preise in einem einzigen Modell. 15
40
Für Entwickler kann diese Kombination die Wechselkosten senken und selbst betriebene oder auf mehrere Anbieter verteilte Deployments praktikabler machen. Für Anbieter geschlossener Modelle steigt damit der Druck auf Preise und Margen – besonders bei Coding-Workloads. Dort können Tokenvolumen, Latenz, Kontrolle über den Betrieb und verfügbare Hardware ebenso wichtig sein wie die Position in einer Rangliste.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Z.ai bestätigte am 26. August 2026, dass das anonyme Gratismodell Ox Alpha GLM 5.3 Flash war – ein Mixture of Experts Modell mit 320 Milliarden Parametern, davon 18 Milliarden pro Token aktiv, und MIT lizenzierten Gew...
Z.ai bestätigte am 26. August 2026, dass das anonyme Gratismodell Ox Alpha GLM 5.3 Flash war – ein Mixture of Experts Modell mit 320 Milliarden Parametern, davon 18 Milliarden pro Token aktiv, und MIT lizenzierten Gew... GLM 5.3 Flash verarbeitet nativ Text, Bilder und Videos, bietet rund eine Million Tokens Kontext und kostet laut Z.ais Listenpreis 0,15 US Dollar pro Million Eingabe sowie 0,50 US Dollar pro Million Ausgabe Tokens.
Der Stealth Start verschaffte Z.ai reale Nutzung durch Entwickler und Coding Agenten, bevor das Unternehmen den Namen, die Gewichte und die offizielle Preisstruktur veröffentlichte.
Z.ai bestätigte am 26. August 2026, dass das anonyme Gratismodell Ox Alpha GLM 5.3 Flash war – ein Mixture of Experts Modell mit 320 Milliarden Parametern, davon 18 Milliarden pro Token aktiv, und MIT lizenzierten Gew...
Veröffentlicht vonBearbeitet mit GPT-5.6 LunaBilder erstellt mit GPT Image 1.5
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Am 26. August 2026 endete das Rätsel: Z.ai bestätigte, dass Ox Alpha – das anonym über OpenRouter und OpenCode angebotene Modell – GLM-5.3-Flash war. Z.ai bezeichnet es als erstes nativ multimodales Modell der GLM-5-Familie. Es kommt mit offenen Gewichten, einem Kontextfenster von rund einer Million Tokens und einer Ausrichtung auf Programmierung sowie lang laufende Agentenaufgaben. 15
40
Die wichtigere Geschichte ist jedoch größer als die Identität des Modells. Ox Alpha verband eine kostenlose, anonyme Vorschau mit einer Nutzung durch viele Entwickler und wurde anschließend zu einem benannten und herunterladbaren Produkt. Damit konnte Z.ai seine Infrastruktur unter realen Bedingungen testen und zugleich Aufmerksamkeit für den späteren Launch aufbauen.
GLM-5.3-Flash ist ein Mixture-of-Experts-Modell mit 320 Milliarden Gesamtparametern und 18 Milliarden aktiven Parametern pro Token. Es nimmt nativ Text, Bilder und Videos entgegen und erzeugt Text als Ausgabe. Die angegebene Kontextkapazität liegt bei etwa einer Million Tokens. Je nach Plattform wird die Grenze allerdings etwas anders dargestellt: Z.ais Dokumentation beschreibt das Design mit einer Million Tokens, während OpenRouter ein Kontextfenster von 1.310.720 Tokens ausweist. 1
2
3
40
Z.ai veröffentlichte die Gewichte unter der MIT-Lizenz. Dadurch lässt sich das Modell deutlich flexibler einsetzen als ein ausschließlich über eine geschlossene API verfügbares System. Nach dem Ende der anonymen Vorschau wurde es auf OpenRouter auch unter seinem öffentlichen Namen gelistet. 3
4
8
Wichtig ist die Abgrenzung zum größeren Modell GLM-5.3, das Anfang August angekündigt wurde. Berichten zufolge handelt es sich bei GLM-5.3-Flash um ein eigenständiges, kostengünstigeres 320B-A18B-Modell – nicht um dieselbe Produktvariante wie die größere GLM-5.3-Linie. 10
Z.ai zufolge verbessert GLM-5.3-Flash die Leistung von GLM-5.2 und senkt zugleich die Betriebskosten. In den zum Start genannten Ergebnissen erreichte das Modell 63,4 Punkte bei DeepSWE v1.1, gegenüber 46,2 Punkten für GLM-5.2. Außerdem meldete Z.ai 29,0 Punkte auf einem internen Coding-Benchmark – nahezu so viel wie die 29,5 Punkte, die für Claude Opus 4.8 genannt wurden. 3
16
Diese Zahlen zeigen, wie Z.ai das Modell positioniert, sind aber keine unabhängige Bestätigung einer Gleichwertigkeit mit dem Modell von Anthropic. Entscheidend sind unter anderem Benchmark-Definitionen, Testbedingungen, Prompts und die Möglichkeit, die Ergebnisse zu reproduzieren. Die vorsichtigste Schlussfolgerung lautet daher: Z.ai beansprucht starke Leistungen bei Programmierung und Agentenaufgaben zu deutlich niedrigeren Kosten. Ein eindeutiger Sieg über geschlossene Spitzenmodelle ist damit nicht belegt.
Das auffälligste Merkmal von Ox Alpha war zunächst der kostenlose Zugang während der anonymen Vorschau. Diese Phase endete, als das Modell seinen öffentlichen Namen erhielt. Z.ais angegebener Listenpreis beträgt 0,15 US-Dollar pro Million Eingabe-Tokens und 0,50 US-Dollar pro Million Ausgabe-Tokens. 1
3
OpenRouter zeigte rund um den Start einen niedrigeren Einführungspreis von 0,075 US-Dollar pro Million Eingabe-Tokens und 0,25 US-Dollar pro Million Ausgabe-Tokens. 2 Die Unterscheidung ist wichtig: Gratisvorschau, Listenpreis von Z.ai und ein zeitlich oder plattformbezogener Einführungsrabatt sind drei verschiedene Zugangsbedingungen.
Selbst zum Listenpreis bleibt die Kostenstruktur ein zentraler Teil des Angebots. Coding-Agenten können große Mengen an Kontext und Ausgaben verbrauchen. Deshalb kann ein niedriger Tokenpreis die Modellwahl ebenso stark beeinflussen wie ein kleiner Vorsprung in einem Benchmark.
Z.ai erklärte, GLM-5.3-Flash laufe vollständig auf in China gefertigten KI-Beschleunigern. 15 Berichte über das Serving-System beschreiben einen angepassten Stack auf Basis von SGLang. Zum Einsatz kommen demnach unter anderem Quantisierung, Tensor-Parallelismus, gemischte Cache-Formate, Layer-Splitting sowie eine getrennte Encode-, Prefill- und Decode-Architektur. Ziel sei eine bessere Leistung im gesamten Bereitstellungsprozess unter den Bedingungen heimischer Hardware.
25
Damit setzt Z.ai eine frühere Erzählung rund um die GLM-Familie fort. Das Unternehmen erklärte bereits, die Modelle auf Huawei-Ascend-Prozessoren trainiert zu haben – ohne Nvidia-Hardware. Berichten zufolge schränkt die Aufnahme von Z.ai auf die US-amerikanische Entity List den Zugang zu Nvidias Beschleunigern H100, H200 und B200 ein. 26
Die Behauptung zur Inferenz ist strategisch bedeutsam, sollte aber als Aussage des Unternehmens beziehungsweise als Branchenbericht verstanden werden – nicht als vollständig geprüfter Hardwarevergleich. Belastbarer ist die Feststellung, dass Z.ai seinen Modell-Stack als fähig präsentiert, ein großes multimodales Modell bereitzustellen, ohne auf Nvidias führende Rechenzentrums-GPUs angewiesen zu sein.
Die anonyme Veröffentlichung wirkt wie ein bewusstes Stealth-Launch-Modell: ein leistungsfähiges Modell zunächst ohne Zuordnung veröffentlichen, es über beliebte Coding-Zugänge kostenlos anbieten, die Nutzung durch Entwickler beobachten und das Produkt erst danach enthüllen. Z.ai wurde bereits mit einem früheren Test namens „Pony Alpha“ in Verbindung gebracht, der einem ähnlichen Muster gefolgt sein soll. Community-Forscher versuchten unterdessen, Ox Alpha anhand von Tokenizer-Verhalten, Hinweisen bei der Videoverarbeitung und API-Fehlermustern zu identifizieren. 7
11
13
Einige Berichte zum Launch nannten außerdem ungewöhnlich hohe Nutzungszahlen und große Begeisterung in der Entwicklergemeinschaft. Nicht jede dieser Zahlen oder jedes Zitat lässt sich anhand des verfügbaren Materials unabhängig bestätigen. Sie sollten daher als Berichte aus der Startphase und nicht als geprüfte Adoptionsdaten verstanden werden. 14
GLM-5.3-Flash beweist nicht, dass Z.ai OpenAI oder Anthropic über das gesamte Spektrum moderner Spitzenmodelle überholt hat. Die Veröffentlichung zeigt aber eine disruptive Kombination: multimodale Eingaben, sehr langen Kontext, offene Gewichte unter MIT-Lizenz, eine Spezialisierung auf Coding-Agenten und niedrige API-Preise in einem einzigen Modell. 15
40
Für Entwickler kann diese Kombination die Wechselkosten senken und selbst betriebene oder auf mehrere Anbieter verteilte Deployments praktikabler machen. Für Anbieter geschlossener Modelle steigt damit der Druck auf Preise und Margen – besonders bei Coding-Workloads. Dort können Tokenvolumen, Latenz, Kontrolle über den Betrieb und verfügbare Hardware ebenso wichtig sein wie die Position in einer Rangliste.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Z.ai bestätigte am 26. August 2026, dass das anonyme Gratismodell Ox Alpha GLM 5.3 Flash war – ein Mixture of Experts Modell mit 320 Milliarden Parametern, davon 18 Milliarden pro Token aktiv, und MIT lizenzierten Gew...
Z.ai bestätigte am 26. August 2026, dass das anonyme Gratismodell Ox Alpha GLM 5.3 Flash war – ein Mixture of Experts Modell mit 320 Milliarden Parametern, davon 18 Milliarden pro Token aktiv, und MIT lizenzierten Gew... GLM 5.3 Flash verarbeitet nativ Text, Bilder und Videos, bietet rund eine Million Tokens Kontext und kostet laut Z.ais Listenpreis 0,15 US Dollar pro Million Eingabe sowie 0,50 US Dollar pro Million Ausgabe Tokens.
Der Stealth Start verschaffte Z.ai reale Nutzung durch Entwickler und Coding Agenten, bevor das Unternehmen den Namen, die Gewichte und die offizielle Preisstruktur veröffentlichte.