Le 26 août 2026, Z.ai a confirmé que le modèle anonyme Ox Alpha était GLM 5.3 Flash, un modèle à 320 milliards de paramètres dont 18 milliards sont actifs à chaque jeton, publié sous licence MIT. GLM 5.3 Flash accepte nativement le texte, les images et la vidéo, offre un contexte d’environ un million de jetons et co...
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Le mystère a pris fin le 26 août 2026 : Z.ai a confirmé qu’Ox Alpha, le modèle anonyme proposé sur OpenRouter et OpenCode, était en réalité GLM-5.3-Flash. L’entreprise le présente comme le premier modèle nativement multimodal de la famille GLM-5, avec des poids ouverts, une fenêtre de contexte d’un million de jetons et une spécialisation dans le développement logiciel et les tâches d’agents autonomes au long cours. 15
40
L’annonce est toutefois plus intéressante que la seule identité du modèle. Ox Alpha associait un accès gratuit et anonyme à une utilisation massive par les développeurs, avant de devenir un produit officiellement nommé et téléchargeable. Pour Z.ai, cette formule a servi à la fois de test grandeur nature de son infrastructure et de moyen de créer de l’attente autour du lancement.
GLM-5.3-Flash est un modèle à mixture of experts — une architecture qui n’active qu’une partie du réseau pour chaque requête — comptant 320 milliards de paramètres au total et 18 milliards de paramètres actifs par jeton. Il accepte nativement le texte, les images et la vidéo, mais génère du texte. Sa capacité annoncée est d’environ un million de jetons. La limite exacte peut néanmoins varier selon la plateforme : la documentation de Z.ai décrit une conception à un million de jetons, tandis qu’OpenRouter affiche une fenêtre de 1 310 720 jetons. 1
2
3
40
Z.ai a publié les poids sous licence MIT, ce qui rend le modèle nettement plus facile à déployer et à adapter qu’un service exclusivement accessible par API. Après la fin de la phase anonyme, le modèle est également apparu sous son nom officiel sur OpenRouter. 3
4
8
Il faut par ailleurs éviter une confusion avec le GLM-5.3 annoncé plus tôt en août. Les informations disponibles présentent GLM-5.3-Flash comme un modèle distinct, de taille inférieure et doté de 320 milliards de paramètres — ou 320B-A18B — plutôt que comme une simple variante du GLM-5.3 principal. 10
Z.ai affirme que GLM-5.3-Flash améliore les résultats de GLM-5.2 tout en réduisant les coûts de service. Dans les résultats cités lors du lancement, il obtient 63,4 points sur DeepSWE v1.1, contre 46,2 pour GLM-5.2. Z.ai rapporte également 29,0 points sur son benchmark interne de programmation, presque au niveau des 29,5 points attribués à Claude Opus 4.8. 3
16
Ces chiffres donnent une indication claire du positionnement recherché par Z.ai, mais ils ne constituent pas une confirmation indépendante d’une équivalence avec le modèle d’Anthropic. Les définitions des benchmarks, les paramètres d’évaluation, les prompts et la possibilité de reproduire les tests sont essentiels. La conclusion la plus prudente est donc la suivante : Z.ai revendique de solides performances en programmation et pour les agents, à un coût nettement inférieur — pas que GLM-5.3-Flash a définitivement dépassé les modèles propriétaires de pointe.
L’un des principaux attraits d’Ox Alpha était la possibilité de l’essayer gratuitement durant sa phase anonyme. Cette période s’est achevée lorsque le modèle a reçu son identité officielle. Le tarif catalogue annoncé par Z.ai est de 0,15 dollar par million de jetons en entrée et 0,50 dollar par million de jetons en sortie. 1
3
Au moment du lancement, OpenRouter affichait un tarif promotionnel inférieur : 0,075 dollar par million de jetons en entrée et 0,25 dollar en sortie. 2 Il faut donc distinguer trois conditions d’accès : l’aperçu gratuit, le prix catalogue de Z.ai et la réduction temporaire proposée par une plateforme donnée.
Même au tarif catalogue, l’économie du modèle est au cœur de son intérêt. Les agents de programmation peuvent consommer d’importantes quantités de contexte et produire beaucoup de sorties. Dans ce type d’usage, le prix par jeton peut peser dans le choix d’un modèle autant qu’un léger avantage sur un benchmark.
Z.ai affirme que GLM-5.3-Flash fonctionne entièrement sur des accélérateurs d’intelligence artificielle fabriqués en Chine. 15 Des informations consacrées à son système de service décrivent une pile adaptée autour de SGLang, avec notamment de la quantification, du parallélisme tensoriel, plusieurs formats de cache, le découpage des couches et une architecture séparant l’encodage, le préremplissage du contexte et le décodage. L’objectif annoncé est d’améliorer les performances de bout en bout tout en tenant compte des contraintes du matériel national.
25
Cette annonce prolonge le discours déjà associé à la famille GLM : Z.ai a affirmé que ses modèles avaient été entraînés sur des processeurs Huawei Ascend sans utiliser de matériel Nvidia. Des informations de presse rappellent également que l’inscription de Z.ai sur la liste américaine des entités soumises à des restrictions limite son accès aux accélérateurs Nvidia H100, H200 et B200. 26
La portée stratégique de cette affirmation est importante, mais elle doit être interprétée comme une déclaration de l’entreprise relayée par des sources sectorielles, et non comme une comparaison indépendante et auditée des performances matérielles. Le constat le mieux étayé est que Z.ai veut démontrer qu’un grand modèle multimodal peut être servi à grande échelle sans dépendre des principaux GPU de centre de données de Nvidia.
Le déploiement anonyme semble avoir suivi une méthode délibérée : publier un modèle performant sans révéler son origine, le rendre accessible gratuitement via des outils populaires de programmation, observer les usages réels des développeurs, puis dévoiler le produit une fois les retours accumulés. Z.ai avait déjà été associée à un test baptisé « Pony Alpha », fondé sur une approche similaire. De leur côté, des membres de la communauté ont tenté d’identifier Ox Alpha à partir de son comportement de tokenizer, de ses indices liés au traitement vidéo et de certains messages d’erreur d’API. 7
11
13
Des articles publiés au moment de la révélation ont aussi évoqué des volumes d’utilisation et un enthousiasme particulièrement élevés. Ces chiffres et certaines citations ne sont toutefois pas vérifiés indépendamment dans les éléments disponibles ; ils doivent donc être considérés comme des affirmations de lancement, et non comme des données d’adoption auditées. 14
GLM-5.3-Flash ne prouve pas que Z.ai a dépassé OpenAI ou Anthropic sur l’ensemble des capacités des modèles de pointe. En revanche, il réunit dans une même offre plusieurs caractéristiques difficiles à ignorer : entrées multimodales, contexte très long, poids ouverts sous licence MIT, spécialisation dans les agents de programmation et prix d’API bas. 15
40
Pour les développeurs, cette combinaison peut réduire le coût d’un changement de fournisseur et rendre plus réalistes l’auto-hébergement ou les déploiements multi-fournisseurs. Pour les acteurs des modèles fermés, elle accentue la pression sur les prix et les marges — en particulier pour les usages de programmation, où le volume de jetons, la latence, le contrôle du déploiement et la disponibilité du matériel peuvent compter autant que la première place dans un classement.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Le 26 août 2026, Z.ai a confirmé que le modèle anonyme Ox Alpha était GLM 5.3 Flash, un modèle à 320 milliards de paramètres dont 18 milliards sont actifs à chaque jeton, publié sous licence MIT.
Le 26 août 2026, Z.ai a confirmé que le modèle anonyme Ox Alpha était GLM 5.3 Flash, un modèle à 320 milliards de paramètres dont 18 milliards sont actifs à chaque jeton, publié sous licence MIT. GLM 5.3 Flash accepte nativement le texte, les images et la vidéo, offre un contexte d’environ un million de jetons et coûte 0,15 dollar par million de jetons en entrée et 0,50 dollar en sortie selon le tarif affiché...
Le lancement gratuit et sans marque a permis à Z.ai de tester son infrastructure avec des usages réels avant de dévoiler le modèle, une stratégie qui pourrait accentuer la pression sur les fournisseurs propriétaires p...
Le 26 août 2026, Z.ai a confirmé que le modèle anonyme Ox Alpha était GLM 5.3 Flash, un modèle à 320 milliards de paramètres dont 18 milliards sont actifs à chaque jeton, publié sous licence MIT. GLM 5.3 Flash accepte nativement le texte, les images et la vidéo, offre un contexte d’environ un million de jetons et co...
Publié parModifié avec GPT-5.6 LunaImages générées avec GPT Image 1.5
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What did Z.ai, the Chinese AI company formerly known as Zhipu AI, reveal about the anonymous “Ox Alpha” model that appeared free and without. Article summary: Z.ai disclosed on August 26 that the previously anonymous, free “Ox Alpha” preview was **GLM-5.3-Flash**—the first natively multimodal GLM-5 model. It is an open-weight, low-cost coding and agent model whose stealth rele. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Le mystère a pris fin le 26 août 2026 : Z.ai a confirmé qu’Ox Alpha, le modèle anonyme proposé sur OpenRouter et OpenCode, était en réalité GLM-5.3-Flash. L’entreprise le présente comme le premier modèle nativement multimodal de la famille GLM-5, avec des poids ouverts, une fenêtre de contexte d’un million de jetons et une spécialisation dans le développement logiciel et les tâches d’agents autonomes au long cours. 15
40
L’annonce est toutefois plus intéressante que la seule identité du modèle. Ox Alpha associait un accès gratuit et anonyme à une utilisation massive par les développeurs, avant de devenir un produit officiellement nommé et téléchargeable. Pour Z.ai, cette formule a servi à la fois de test grandeur nature de son infrastructure et de moyen de créer de l’attente autour du lancement.
GLM-5.3-Flash est un modèle à mixture of experts — une architecture qui n’active qu’une partie du réseau pour chaque requête — comptant 320 milliards de paramètres au total et 18 milliards de paramètres actifs par jeton. Il accepte nativement le texte, les images et la vidéo, mais génère du texte. Sa capacité annoncée est d’environ un million de jetons. La limite exacte peut néanmoins varier selon la plateforme : la documentation de Z.ai décrit une conception à un million de jetons, tandis qu’OpenRouter affiche une fenêtre de 1 310 720 jetons. 1
2
3
40
Z.ai a publié les poids sous licence MIT, ce qui rend le modèle nettement plus facile à déployer et à adapter qu’un service exclusivement accessible par API. Après la fin de la phase anonyme, le modèle est également apparu sous son nom officiel sur OpenRouter. 3
4
8
Il faut par ailleurs éviter une confusion avec le GLM-5.3 annoncé plus tôt en août. Les informations disponibles présentent GLM-5.3-Flash comme un modèle distinct, de taille inférieure et doté de 320 milliards de paramètres — ou 320B-A18B — plutôt que comme une simple variante du GLM-5.3 principal. 10
Z.ai affirme que GLM-5.3-Flash améliore les résultats de GLM-5.2 tout en réduisant les coûts de service. Dans les résultats cités lors du lancement, il obtient 63,4 points sur DeepSWE v1.1, contre 46,2 pour GLM-5.2. Z.ai rapporte également 29,0 points sur son benchmark interne de programmation, presque au niveau des 29,5 points attribués à Claude Opus 4.8. 3
16
Ces chiffres donnent une indication claire du positionnement recherché par Z.ai, mais ils ne constituent pas une confirmation indépendante d’une équivalence avec le modèle d’Anthropic. Les définitions des benchmarks, les paramètres d’évaluation, les prompts et la possibilité de reproduire les tests sont essentiels. La conclusion la plus prudente est donc la suivante : Z.ai revendique de solides performances en programmation et pour les agents, à un coût nettement inférieur — pas que GLM-5.3-Flash a définitivement dépassé les modèles propriétaires de pointe.
L’un des principaux attraits d’Ox Alpha était la possibilité de l’essayer gratuitement durant sa phase anonyme. Cette période s’est achevée lorsque le modèle a reçu son identité officielle. Le tarif catalogue annoncé par Z.ai est de 0,15 dollar par million de jetons en entrée et 0,50 dollar par million de jetons en sortie. 1
3
Au moment du lancement, OpenRouter affichait un tarif promotionnel inférieur : 0,075 dollar par million de jetons en entrée et 0,25 dollar en sortie. 2 Il faut donc distinguer trois conditions d’accès : l’aperçu gratuit, le prix catalogue de Z.ai et la réduction temporaire proposée par une plateforme donnée.
Même au tarif catalogue, l’économie du modèle est au cœur de son intérêt. Les agents de programmation peuvent consommer d’importantes quantités de contexte et produire beaucoup de sorties. Dans ce type d’usage, le prix par jeton peut peser dans le choix d’un modèle autant qu’un léger avantage sur un benchmark.
Z.ai affirme que GLM-5.3-Flash fonctionne entièrement sur des accélérateurs d’intelligence artificielle fabriqués en Chine. 15 Des informations consacrées à son système de service décrivent une pile adaptée autour de SGLang, avec notamment de la quantification, du parallélisme tensoriel, plusieurs formats de cache, le découpage des couches et une architecture séparant l’encodage, le préremplissage du contexte et le décodage. L’objectif annoncé est d’améliorer les performances de bout en bout tout en tenant compte des contraintes du matériel national.
25
Cette annonce prolonge le discours déjà associé à la famille GLM : Z.ai a affirmé que ses modèles avaient été entraînés sur des processeurs Huawei Ascend sans utiliser de matériel Nvidia. Des informations de presse rappellent également que l’inscription de Z.ai sur la liste américaine des entités soumises à des restrictions limite son accès aux accélérateurs Nvidia H100, H200 et B200. 26
La portée stratégique de cette affirmation est importante, mais elle doit être interprétée comme une déclaration de l’entreprise relayée par des sources sectorielles, et non comme une comparaison indépendante et auditée des performances matérielles. Le constat le mieux étayé est que Z.ai veut démontrer qu’un grand modèle multimodal peut être servi à grande échelle sans dépendre des principaux GPU de centre de données de Nvidia.
Le déploiement anonyme semble avoir suivi une méthode délibérée : publier un modèle performant sans révéler son origine, le rendre accessible gratuitement via des outils populaires de programmation, observer les usages réels des développeurs, puis dévoiler le produit une fois les retours accumulés. Z.ai avait déjà été associée à un test baptisé « Pony Alpha », fondé sur une approche similaire. De leur côté, des membres de la communauté ont tenté d’identifier Ox Alpha à partir de son comportement de tokenizer, de ses indices liés au traitement vidéo et de certains messages d’erreur d’API. 7
11
13
Des articles publiés au moment de la révélation ont aussi évoqué des volumes d’utilisation et un enthousiasme particulièrement élevés. Ces chiffres et certaines citations ne sont toutefois pas vérifiés indépendamment dans les éléments disponibles ; ils doivent donc être considérés comme des affirmations de lancement, et non comme des données d’adoption auditées. 14
GLM-5.3-Flash ne prouve pas que Z.ai a dépassé OpenAI ou Anthropic sur l’ensemble des capacités des modèles de pointe. En revanche, il réunit dans une même offre plusieurs caractéristiques difficiles à ignorer : entrées multimodales, contexte très long, poids ouverts sous licence MIT, spécialisation dans les agents de programmation et prix d’API bas. 15
40
Pour les développeurs, cette combinaison peut réduire le coût d’un changement de fournisseur et rendre plus réalistes l’auto-hébergement ou les déploiements multi-fournisseurs. Pour les acteurs des modèles fermés, elle accentue la pression sur les prix et les marges — en particulier pour les usages de programmation, où le volume de jetons, la latence, le contrôle du déploiement et la disponibilité du matériel peuvent compter autant que la première place dans un classement.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Le 26 août 2026, Z.ai a confirmé que le modèle anonyme Ox Alpha était GLM 5.3 Flash, un modèle à 320 milliards de paramètres dont 18 milliards sont actifs à chaque jeton, publié sous licence MIT.
Le 26 août 2026, Z.ai a confirmé que le modèle anonyme Ox Alpha était GLM 5.3 Flash, un modèle à 320 milliards de paramètres dont 18 milliards sont actifs à chaque jeton, publié sous licence MIT. GLM 5.3 Flash accepte nativement le texte, les images et la vidéo, offre un contexte d’environ un million de jetons et coûte 0,15 dollar par million de jetons en entrée et 0,50 dollar en sortie selon le tarif affiché...
Le lancement gratuit et sans marque a permis à Z.ai de tester son infrastructure avec des usages réels avant de dévoiler le modèle, une stratégie qui pourrait accentuer la pression sur les fournisseurs propriétaires p...