Zhipu AI bestätigte am 26. August 2026, dass das anonyme Modell „Ox Alpha“, in chinesischen Communities auch „Niu Lai“ genannt, GLM 5.3 Flash ist – ein Modell mit offenen Gewichten und nativer Multimodalität.
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What did Zhipu AI reveal on August 26, 2026, about the anonymous “Ox Alpha” model known as “Niu Lai,” including its identity as GLM 5.3 Flas. Article summary: On August 26, Zhipu AI (Z.ai) disclosed that the anonymous “Ox Alpha”/“Niu Lai” model was its GLM 5.3 Flash: an open weight, native multimodal mixture of experts model tested anonymously before release.. Topic tags: general web, ai, productivity, code, api. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers, cl
Am 26. August 2026 lüftete Zhipu AI – international auch als Z.ai bekannt – das Geheimnis um das anonyme Modell „Ox Alpha“. In chinesischen Online-Communities war es unter dem Namen „Niu Lai“ bekannt. Das Unternehmen bestätigte, dass dahinter GLM-5.3-Flash steckt: ein Modell mit offenen Gewichten und nativer Multimodalität, das vor seiner offiziellen Vorstellung bewusst anonym getestet worden war. 1
4
6
Ox Alpha war zunächst ohne Firmenlogo und zu praktisch kostenlosen Konditionen auf OpenRouter und OpenCode verfügbar. Beide Plattformen werden häufig von Entwicklern genutzt, um Sprachmodelle und KI-Agenten auszuprobieren.
Die Nachfrage war außergewöhnlich hoch: Berichten zufolge verarbeitete das Modell in den ersten fünf Tagen mehr als 50 Billionen Tokens. Spätere Angaben nannten über 60 Billionen Tokens innerhalb von sechs Tagen. Damit führte Ox Alpha zeitweise die Nutzungsranglisten beider Plattformen an und erreichte in Spitzenzeiten mehr als das Doppelte der Nutzung vergleichbarer DeepSeek-Modelle. 3
Die Zahlen stammen aus Berichten und Unternehmensangaben; sie sind daher nicht mit einem unabhängigen Audit gleichzusetzen. Dennoch machen sie deutlich, dass der Test nicht nur ein kleiner Vorabversuch war, sondern eine reale Belastungsprobe mit globaler Entwicklernachfrage.
Nach Angaben von Zhipu AI wurde der Dienst vollständig auf einem Cluster mit mehr als 100.000 in China gefertigten Chips betrieben. Das Unternehmen erklärte, Softwareoptimierungen hätten die Hardwareeffizienz und die Kosten pro Token auf ein Niveau gebracht, das mit gängigen Nvidia-GPUs vergleichbar sei. 3
6
Welche Chipanbieter genau beteiligt waren, legte Zhipu nicht offen. Huawei, Moore Threads und Hygon wurden in Berichten als mögliche Lieferanten genannt. Das bleibt jedoch unbestätigte Spekulation und ist keine offizielle Bestätigung durch Zhipu AI. 40
Die Aussage sollte deshalb präzise eingeordnet werden: Sie belegt nicht, dass chinesische Chips Nvidia-Hardware allgemein gleichwertig sind oder dass die Inferenzkosten bei allen Modellen und Anwendungen identisch ausfallen. Sie zeigt vielmehr, dass sich eine sehr große, reale Inferenzlast mit umfangreicher Systemoptimierung auf einer nicht von Nvidia dominierten, inländischen Plattform bewältigen lässt. 3
6
Der Test ist vor allem deshalb bemerkenswert, weil er die Bedeutung der Softwareebene sichtbar macht. Ein auf SGLang basierendes, speziell angepasstes Inferenzsystem soll unter anderem folgende Verfahren kombiniert haben:
Diese Maßnahmen sollten Speicher, Bandbreite, Kommunikation und Auslastung bei einem Kontextfenster von bis zu einer Million Tokens effizienter verwalten. 4
7
Zhipu zufolge verbesserte sich die End-to-End-Leistung des Dienstes gegenüber der ursprünglichen Ausgangskonfiguration um etwa das Dreifache. Die spätere SGLang-Dokumentation weist ebenfalls auf höheren Durchsatz und eine deutlich größere FP8-Cache-Kapazität gegenüber einer BF16-Vergleichskonfiguration hin. Das ist allerdings kein unabhängiges Audit der ursprünglichen Dreifach-Angabe von Zhipu. 2
Für Nvidia bedeutet das: Spezialisierte Software-Stacks und Inferenz-Engines können die Abhängigkeit von CUDA bei bestimmten Produktions-Workloads verringern. Nvidias breiteres Ökosystem, seine Werkzeuge, Entwicklerbasis und Vorteile beim Training werden dadurch jedoch nicht beseitigt. Eine weitergehende Schlussfolgerung wäre durch die vorliegenden Belege nicht gedeckt.
GLM-5.3-Flash ist als Mixture-of-Experts-Modell aufgebaut. Es umfasst insgesamt 320 Milliarden Parameter, aktiviert pro Token aber nur etwa 18 Milliarden. Das Modell unterstützt ein Kontextfenster von 1.048.576 Tokens und wurde als native multimodale Variante der GLM-5-Reihe positioniert. 5
7
Beim Artificial Analysis Intelligence Index soll GLM-5.3-Flash einen Wert von 57 erreicht haben – denselben dort berichteten Wert wie Claude Opus 4.8. Das bedeutet jedoch nur eine Gleichheit bei diesem zusammengesetzten Index, nicht automatisch identische Ergebnisse in jedem Benchmark oder bei jeder praktischen Agentenaufgabe. 1
Zhipu positionierte das Modell gegen effiziente Frontier-Modelle wie DeepSeek V4 Flash und Pro und versprach zugleich deutlich niedrigere Inferenzpreise. Für einen belastbaren Vergleich von Benchmark zu Benchmark mit beiden DeepSeek-Varianten reichen die vorliegenden Belege nicht aus.
Die von Zhipu AI veröffentlichten API-Preise wurden mit folgenden Sätzen angegeben:
Zeitgenössische Berichte ordneten das als ungefähr ein Zehntel des Preises von GLM-5.3 und etwa ein Vierzigstel des Preises von Claude Opus 4.8 ein. Solche Verhältnisse hängen allerdings davon ab, ob Eingabe- oder Ausgabetokens, welcher Kontextbereich und welcher konkrete Tarif verglichen werden. 1
Der eigentliche Kern der Enthüllung liegt damit nicht nur im günstigen Preis. Zhipu AI demonstrierte mit dem anonymen Ox-Alpha-Test zugleich, dass ein großes multimodales Modell mit hoher Nachfrage, spezialisierter Inferenzsoftware und einem umfangreichen Cluster chinesischer Chips betrieben werden kann – ohne dass Nvidia-Hardware als alleinige Grundlage genannt wurde.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Zhipu AI bestätigte am 26. August 2026, dass das anonyme Modell „Ox Alpha“, in chinesischen Communities auch „Niu Lai“ genannt, GLM 5.3 Flash ist – ein Modell mit offenen Gewichten und nativer Multimodalität.
Zhipu AI bestätigte am 26. August 2026, dass das anonyme Modell „Ox Alpha“, in chinesischen Communities auch „Niu Lai“ genannt, GLM 5.3 Flash ist – ein Modell mit offenen Gewichten und nativer Multimodalität. Der kostenlose Test auf OpenRouter und OpenCode soll innerhalb von fünf Tagen mehr als 50 Billionen Tokens verarbeitet haben; später war von über 60 Billionen Tokens in sechs Tagen die Rede.
Laut Zhipu AI lief die Inferenz vollständig auf einem Cluster mit mehr als 100.000 in China gefertigten Chips.