Ox Alpha war GLM 5.3 Flash von Zhipu AI. Das Unternehmen bestätigte die Identität am 26. Das Modell richtet sich an Programmierung, visuelle Entwicklungsaufgaben, lange Agenten Workflows und Tool Nutzung.
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: What is Zhipu AI’s GLM-5.3-Flash—the model previously released anonymously on OpenRouter as “Ox Alpha”—and how did its August 20, 2026 blind. Article summary: GLM-5.3-Flash is Zhipu AI’s (Z.ai’s) open-weight, natively multimodal mixture-of-experts model—the system anonymously trialed as “Ox Alpha” before Zhipu identified it on August 26. It is designed chiefly for coding, GUI/. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
GLM-5.3-Flash ist das Modell hinter dem anonymen Ox Alpha-Endpunkt, der am 20. August 2026 auf OpenRouter und weiteren Entwicklerplattformen auftauchte. Zhipu AI – international auch als Z.ai bekannt – bestätigte am 26. August die Identität. Der zunächst nicht gekennzeichnete Zugang diente laut Unternehmen als Praxistest für Programmierung, multimodale Aufgaben und agentische Workflows. 3
4
Aus dem Rätsel wurde damit ein bemerkenswerter Release für die Open-Model-Szene: ein Mixture-of-Experts-Modell mit insgesamt 320 Milliarden Parametern, von denen pro Token nur 18 Milliarden aktiviert werden. Hinzu kommen ein Kontextfenster von rund einer Million Tokens, native multimodale Eingaben und frei veröffentlichte Gewichte unter der MIT-Lizenz. 3
6
8
Ox Alpha erschien zunächst ohne Modellkarte, Herstellerangabe oder ausführliches Datenblatt. Entwickler fanden einen kostenlosen Endpunkt mit langem Kontext und Unterstützung für multimodale Eingaben. Besonders bei Programmieraufgaben und Agenten-Workflows fiel die praktische Leistung auf – und heizte die Spekulationen über das verantwortliche KI-Labor an. 13
16
Zhipu bezeichnete den Preview als bewusst anonymisierten Test. Ohne Markenname und technische Eckdaten sollten Entwickler das System anhand seiner Ausgaben beurteilen – nicht anhand des Rufs des Anbieters, der Parameterzahl oder der Marketingkampagne. Zugleich sammelte das Unternehmen Nutzungsdaten und Rückmeldungen aus realen Softwareentwicklungs- und Agenten-Workloads. 13
15
Berichten zufolge stellte Zhipu während des Tests täglich etwa 100 Billionen Tokens kostenlos bereit. Auch Stripe-Mitgründer Patrick Collison soll die Qualität des Modells gelobt haben. Solche Reaktionen machten den anonymen Endpunkt zu einem viel beachteten Launch. Sie sind allerdings nicht mit einer kontrollierten, unabhängigen Evaluation gleichzusetzen. 13
14
Zhipu erklärte außerdem, der Dienst sei auf in China hergestellten KI-Beschleunigern gelaufen. Die South China Morning Post berichtete von einem Cluster aus 100.000 solchen Chips und davon, dass das Modell vor dem offiziellen Release 62 Billionen Tokens verarbeitet habe. Da andere Berichte bei Kapazität und Nutzung abweichende Werte nennen, sollten diese Zahlen als Angaben des Unternehmens beziehungsweise der Medien verstanden werden – nicht als unabhängig geprüfte Messungen. 7
13
GLM-5.3-Flash ist ein Mixture-of-Experts-Modell (MoE). Sein gesamter Parameterpool umfasst 320 Milliarden Parameter, doch bei der Verarbeitung jedes Tokens werden nur 18 Milliarden davon aktiviert. Dadurch soll das Modell die Kapazität eines sehr großen Systems mit einem geringeren Rechenaufwand pro Inferenzschritt verbinden. 3
4
Das Modell besitzt 45 Schichten und ist laut Zhipu das erste nativ multimodale Modell der GLM-5-Reihe. Es verarbeitet Text, Bilder, Videos, visuelle Dokumente, Dateien und miteinander verflochtene multimodale Eingaben. Das ist vor allem für Agenten relevant, die Benutzeroberflächen untersuchen, Screenshots interpretieren, Dokumente lesen oder das Ergebnis einer Codeausführung bewerten müssen – statt ausschließlich Text zu verarbeiten. 4
11
Zhipu gibt ein Kontextfenster von 1.048.576 Tokens an, also ungefähr einer Million Tokens. Das eröffnet Einsatzmöglichkeiten für große Software-Repositories, lange Agentensitzungen, umfangreiche Dokumentensammlungen und Aufgaben, bei denen Code mit Bildern oder Dateien kombiniert wird. 3
4
Trainiert wurde GLM-5.3-Flash laut Zhipu auf einer neuen Basis mit überarbeiteter Architektur und neuem Trainingsrezept. Das Unternehmen nennt einen multimodalen Trainingskorpus von 30 Billionen Tokens. Damit wird das Modell als eigenständige Entwicklung für Effizienz und multimodale Fähigkeiten positioniert – nicht lediglich als verkleinerte Version von GLM-5.3. 4
16
GLM-5.3-Flash kombiniert lineare Aufmerksamkeit mit sparsamer Aufmerksamkeit. Lineare Aufmerksamkeit soll die Verarbeitung weit auseinanderliegender Informationen in langen Sequenzen günstiger machen. Sparse Attention konzentriert sich dagegen selektiv auf besonders wichtige Wechselwirkungen, bei denen eine höhere Detailtreue erforderlich ist. So soll ein Kompromiss zwischen langem Kontext und beherrschbaren Inferenzkosten entstehen. 4
16
Für lange Kontextfenster beschreibt Zhipu außerdem den IndexPool, der Speicherbedarf und Latenz beim Indexieren reduzieren soll. Hinzu kommen manifold-constrained Hyper-Connections als weitere Technik zur effizienteren Skalierung. Wie groß der praktische Nutzen ausfällt, hängt jedoch unter anderem von Hardware, Sequenzlänge, Serverkonfiguration und konkretem Workload ab. 4
16
Im Vergleich zu GLM-5.3 behauptet Zhipu, GLM-5.3-Flash reduziere den Berechnungsaufwand für Aufmerksamkeit um den Faktor 3,01 und die Nutzung des KV-Caches um den Faktor 4,44, ohne die Qualität bei langen Kontexten einzubüßen. Für Entwickler ist das relevant, weil Attention-Berechnungen und KV-Cache-Speicher bei lang laufenden Agenten zu wichtigen Engpässen werden können. Die genannten Verhältnisse stammen jedoch vor allem aus den technischen Unterlagen von Zhipu und sind nicht als allgemein gültige, unabhängig bestätigte Beschleunigungswerte zu verstehen. 4
GLM-5.3-Flash zielt vor allem auf Programmierung, visuelle Softwareentwicklung, lang laufende Agentenaufgaben und Tool-Nutzung. Die native Bildverarbeitung soll Agenten ermöglichen, Benutzeroberflächen, Render-Ergebnisse und Interaktionsfeedback zu beobachten. Dadurch entsteht eine Schleife zwischen Code, Browsern und grafischen Benutzeroberflächen. 4
Zhipu nennt unter anderem folgende Benchmark-Ergebnisse:
Die Werte passen zur Positionierung als Modell für Softwareentwicklung und Agenten. Vergleiche sollten dennoch vorsichtig interpretiert werden: Ergebnisse bei Agenten-Benchmarks reagieren empfindlich auf Prompts, verfügbare Tools, zusätzliche Programmiergerüste, Hardware, Zeitlimits und die jeweilige Evaluationsversion. Die veröffentlichten Zahlen sind daher zunächst als von Zhipu gemeldete Ergebnisse zu lesen – nicht als endgültige Rangliste aller konkurrierenden Modelle. 4
15
Zhipu veröffentlichte die Gewichte von GLM-5.3-Flash auf Hugging Face unter der permissiven MIT-Lizenz, darunter auch eine BF16-Version. Die Modelldokumentation nennt unter anderem SGLang und vLLM als unterstützte Bereitstellungs-Frameworks. Organisationen können das Modell damit grundsätzlich lokal oder auf eigener Infrastruktur betreiben, statt ausschließlich auf die gehostete API von Z.ai angewiesen zu sein. 3
6
8
Das verändert die praktische Ausgangslage für Entwickler und Unternehmen. Sie können das Modell mit eigenen Repositories, Dokumenten, visuellen Oberflächen und Agentenumgebungen testen. Infrastrukturteams können zudem den tatsächlichen Speicherbedarf, die Serving-Kosten und die Hardwareanforderungen selbst untersuchen.
Die Gesamtgröße von 320 Milliarden Parametern bleibt allerdings eine erhebliche technische Hürde. Dass pro Token nur 18 Milliarden Parameter aktiv sind, senkt den Rechenaufwand – macht den vollständigen Checkpoint aber nicht automatisch leichtgewichtig oder problemlos auf gewöhnlicher Hardware betreibbar.
Der Ox-Alpha-Test war mehr als ein ungewöhnlicher Marketingkniff. Zhipu wollte herausfinden, ob Entwickler das Modell auch dann nutzen und positiv bewerten würden, wenn Name, Parameterzahl und Unternehmenszugehörigkeit verborgen blieben. Dadurch erhielt das Unternehmen reale Workloads und Rückmeldungen, noch bevor der offizielle Name bekannt war. 13
15
Die Methode hat jedoch Grenzen. Ein kostenloser Zugang kann ungewöhnlich viel Traffic anziehen, öffentliche Begeisterung kann durch den Neuigkeitseffekt verstärkt werden, und ein anonymer Test kontrolliert weder Prompts noch die Vergleichsbedingungen zwischen verschiedenen Systemen. Die belastbarste Schlussfolgerung lautet daher enger gefasst: GLM-5.3-Flash weckte bereits vor seiner Enthüllung großes Interesse bei Entwicklern, und Zhipu nutzte dieses Interesse, um Release und Produktpositionierung zu testen.
GLM-5.3-Flash ist die enthüllte Identität von Ox Alpha: ein offenes, nativ multimodales GLM-Modell für effiziente Programmierung und agentische Aufgaben. Zu den wichtigsten Eckdaten zählen 320 Milliarden Gesamtparameter, 18 Milliarden aktive Parameter pro Token, 45 Schichten, ein Kontextfenster von rund einer Million Tokens, eine Kombination aus linearer und sparsamer Aufmerksamkeit sowie Gewichte unter der MIT-Lizenz. 3
4
11
Das entscheidende Versprechen liegt nicht allein in der Größe. Interessant ist die Kombination aus langem Kontext, visueller Eingabe, Tool-Nutzung und einem laut Zhipu geringeren Bereitstellungsaufwand – in einem Modell, das Entwickler herunterladen und selbst betreiben können. Der Blindstart lieferte ungewöhnlich direkte Rückmeldungen aus der Praxis. Für eine verlässliche Einordnung der Architektur-, Effizienz- und Benchmark-Aussagen sind jedoch weiterhin unabhängige und reproduzierbare Tests nötig.
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Ox Alpha war GLM 5.3 Flash von Zhipu AI. Das Unternehmen bestätigte die Identität am 26.
Ox Alpha war GLM 5.3 Flash von Zhipu AI. Das Unternehmen bestätigte die Identität am 26. Das Modell richtet sich an Programmierung, visuelle Entwicklungsaufgaben, lange Agenten Workflows und Tool Nutzung.
GLM 5.3 Flash verfügt über insgesamt 320 Milliarden Parameter, aktiviert pro Token aber nur 18 Milliarden.