Ox Alpha était l’aperçu anonyme du GLM 5.3 Flash de Z.ai, confirmé le 26 août 2026 — et non le modèle encore non identifié d’un nouveau laboratoire. Son contexte de 1 048 576 tokens, ses entrées texte, image et vidéo et son accès gratuit ont rapidement attiré les développeurs d’agents de programmation.
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: What is the anonymous AI model “Ox Alpha” (or “Niu Lai”), launched quietly on OpenRouter and OpenCode on August 20, 2026 and offered free fo. Article summary: Ox Alpha was a short anonymous “stealth” preview, not a still-unidentified new lab model: Z.ai subsequently identified it as GLM-5.3-Flash, a GLM-family model. Its strong early agentic-coding showing and unusually genero. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Ox Alpha n’était pas le nouveau modèle mystérieux que certains imaginaient. Cette préversion anonyme du GLM-5.3-Flash, issue de la famille GLM de Z.ai, est apparue le 20 août 2026 sur OpenRouter et OpenCode sous le nom de fournisseur « Stealth ». Elle proposait un contexte de 1 048 576 tokens, des entrées texte, image et vidéo, l’appel natif d’outils et un accès gratuit pendant la phase de test. Z.ai a ensuite confirmé avoir testé anonymement le GLM-5.3-Flash sous l’identifiant ox-alpha avant sa sortie officielle. 110
L’épisode est devenu un cas d’école : un modèle peut devenir viral auprès des développeurs grâce à sa distribution, à un accès très généreux et à des fonctions adaptées aux agents, avant même de disposer d’une fiche technique ou de benchmarks officiels.
La fiche anonyme présentait Ox Alpha comme un modèle de raisonnement destiné au développement logiciel, au travail agentique de longue durée et aux usages en production. Ses caractéristiques étaient particulièrement ambitieuses pour une préversion gratuite :
stealth/ox-alphaOpenRouter et OpenCode n’annonçaient pas exactement la même durée d’accès. OpenRouter évoquait une période plus courte pour sa propre route, tandis qu’OpenCode parlait d’environ une semaine à compter du 20 août. La fin de la gratuité se situait donc approximativement entre le 24 et le 27 août, plutôt qu’à une date unique valable partout. 2412
Un contexte d’un million de tokens ne rend pas automatiquement un modèle meilleur. Il permet toutefois d’envisager d’autres méthodes de travail. Un agent de programmation peut conserver davantage de fichiers d’un dépôt, de sorties d’outils, de journaux et de contexte visuel dans une même session, au lieu de résumer ou d’abandonner régulièrement une partie des informations. La prise en charge de la vidéo élargissait aussi les usages à la mise à l’épreuve d’interfaces et à d’autres tâches qui dépassent la génération de code textuelle. 343
L’attrait d’Ox Alpha était d’abord très concret. Les développeurs pouvaient essayer gratuitement un modèle de programmation multimodal, doté d’un très long contexte et capable d’utiliser des outils. Pour les équipes qui construisent des agents, le coût d’expérimentation devenait presque nul : réparation de dépôts, interaction avec un navigateur ou tâches de développement logiciel sur plusieurs étapes pouvaient être testées à grande échelle.
La visibilité du modèle a rapidement augmenté. Sur OpenCode, il a brièvement interrompu la série de 56 jours pendant laquelle DeepSeek occupait la première place du classement. Des articles ont également fait état d’un pic exceptionnel d’utilisation en une seule journée. Les chiffres de capacité et de volume de tokens avancés pendant le lancement n’ayant pas tous été vérifiés indépendamment, ils doivent surtout être lus comme un indice d’intérêt intense, et non comme des mesures précises de l’échelle de production. 114
Cette nuance est importante : la popularité pendant une période d’essai gratuit reflète à la fois les capacités, la nouveauté, le prix et la disponibilité. Elle ne suffit pas à démontrer qu’un modèle est globalement le plus performant.
Le chiffre le plus relayé au début a été un résultat de 80 % sur DeepSWE, correspondant à 8 tâches réussies sur 10. C’est un signal encourageant, mais un échantillon de dix tâches est trop réduit pour établir un classement fiable. Une évaluation plus large a ensuite donné un résultat d’environ 63 %, tandis que le chiffre officiel publié par Z.ai pour le GLM-5.3-Flash atteignait 63,4 % sur DeepSWE v1.1. 7634
D’autres évaluations menées sur l’ensemble du test ont obtenu des résultats inférieurs, dont 58,4 % sur 113 tâches. Cette analyse attribuait une part importante des échecs à des problèmes de format de sortie et d’implémentation. Elle illustre la sensibilité des benchmarks d’agents à la configuration du banc de test, aux outils disponibles, aux limites de temps et à la définition même d’une réussite. 4142
La conclusion la plus prudente est donc plus étroite que le titre viral : Ox Alpha a démontré de solides capacités pour les agents de programmation et s’est situé, dans certaines évaluations, au niveau de modèles propriétaires de premier plan. Les éléments disponibles ne prouvent toutefois pas qu’il ait dépassé de façon constante Claude Fable 5 ou l’ensemble des modèles de pointe.
Les comparaisons ne portaient pas toujours sur les mêmes tâches et n’utilisaient ni le même échafaudage d’agent, ni les mêmes conditions d’évaluation. Un échantillon initial de dix tâches pouvait produire 80 % sans être représentatif du benchmark complet. Un test plus large autour de 63 % racontait une autre histoire, tandis qu’un résultat de 58,4 % pouvait intégrer des pénalités supplémentaires liées au format ou au comportement du banc de test.
L’équipe de DeepSWE aurait ensuite estimé que les capacités générales du modèle étaient plutôt comparables à celles de Claude Opus 4.8, et non qu’elles démontraient un dépassement définitif de Claude Fable 5. 35 Les scores de benchmark doivent donc toujours être accompagnés de leur périmètre et de leur protocole : ils ne sont pas interchangeables comme s’ils provenaient d’un classement unique et parfaitement homogène.
Les réactions enthousiastes correspondaient au profil pratique du modèle. Patrick Collison l’a qualifié de « très impressionnant » après l’avoir utilisé via un environnement agentique, tandis que le fondateur d’HermesAgent a indiqué qu’il dépassait plusieurs critères d’évaluation internes de son équipe. 3335
Ces témoignages sont utiles pour mesurer l’efficacité ressentie en situation réelle, notamment dans les tâches de code et d’agent. Ils ne constituent pas pour autant une comparaison contrôlée démontrant une supériorité universelle. Un modèle peut être particulièrement efficace dans un flux de travail donné grâce à la taille de son contexte, à son comportement lors des appels d’outils, à sa vitesse, à ses modalités prises en charge ou à son coût, même si sa position globale dans les benchmarks reste incertaine.
Avant la révélation officielle, des chercheurs ont comparé le comportement observable d’Ox Alpha à celui de modèles susceptibles de provenir des équipes MiMo de Xiaomi, de Google DeepMind ou de Zhipu AI.
Xiaomi semblait plausible, notamment parce que son équipe MiMo avait déjà utilisé un modèle de test anonyme appelé « Hunter Alpha ». Mais une différence de capacités a été relevée : les modèles MiMo étaient associés à la prise en charge de l’audio, alors qu’Ox Alpha acceptait le texte, les images et la vidéo, mais pas l’audio. Xiaomi restait donc une hypothèse intéressante, sans constituer une attribution solide. 2229
Des indices et des publications sur les réseaux sociaux liés à Google ont alimenté d’autres spéculations. Les éléments disponibles ne permettaient toutefois pas d’établir que DeepMind avait conçu ou exploité le point d’accès. Ils demeuraient circonstanciels.
Les indices les plus convaincants avant la révélation orientaient vers la famille GLM de Zhipu. Des tests communautaires ont rapporté que les décomptes de tokens d’Ox Alpha correspondaient à ceux de GLM-5.3 sur des requêtes variées, à l’exception d’un décalage fixe apparent d’environ 75 tokens. Des tests vidéo distincts ont également observé un comportement de consommation correspondant à celui des modèles de vision GLM selon plusieurs caractéristiques d’encodage. 1821
D’autres indices ont été signalés :
reasoning_effort ressemblant à une réponse de l’API GLM ;Pris séparément, ces éléments pouvaient s’expliquer par le routage, des couches intermédiaires, une infrastructure partagée ou une imitation. Ensemble, ils ont rendu l’hypothèse GLM de plus en plus crédible, sans toutefois remplacer une confirmation officielle. La preuve décisive est venue lorsque Z.ai a identifié Ox Alpha comme le GLM-5.3-Flash et documenté sa sortie sous ce nom. 1043
La révélation a transformé Ox Alpha en préversion identifiable d’un produit. La documentation de Z.ai décrit le GLM-5.3-Flash comme un modèle hybride doté de 320 milliards de paramètres au total, dont 18 milliards activés, ainsi que de capacités visuelles natives pour observer des interfaces, afficher des résultats et interpréter les retours d’interaction. 43
La sortie officielle a aussi réglé le principal problème d’un endpoint anonyme : l’incertitude sur sa continuité. Le GLM-5.3-Flash aurait été publié sous licence MIT, avec des poids accessibles aux développeurs qui souhaitent davantage de contrôle sur le déploiement. 1950
Cela ne rend pas automatiquement chaque déploiement sûr ou peu coûteux. Les équipes doivent encore examiner les besoins matériels, les performances d’inférence, les conditions d’API, la gestion des données, les limites de débit, la fiabilité des appels d’outils et la régularité des réponses selon leurs propres usages.
La préversion gratuite a créé l’attention. L’adoption à long terme dépendra de facteurs plus durables :
La leçon centrale d’Ox Alpha n’est donc pas simplement qu’un modèle anonyme a brièvement devancé un concurrent célèbre. Elle est qu’un modèle pensé autour d’un flux de travail convaincant peut se diffuser très vite lorsque les développeurs peuvent l’essayer à grande échelle. Le récit des benchmarks était plus nuancé que ne le laissaient entendre les premiers titres, mais la combinaison — long contexte, multimodalité, utilisation d’outils, programmation agentique et accès peu coûteux — suffisait à justifier l’attention. Maintenant que son identité est établie, le véritable test sera de savoir si cette combinaison reste utile une fois la nouveauté et la gratuité disparues.
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
Ox Alpha était l’aperçu anonyme du GLM 5.3 Flash de Z.ai, confirmé le 26 août 2026 — et non le modèle encore non identifié d’un nouveau laboratoire.
Ox Alpha était l’aperçu anonyme du GLM 5.3 Flash de Z.ai, confirmé le 26 août 2026 — et non le modèle encore non identifié d’un nouveau laboratoire. Son contexte de 1 048 576 tokens, ses entrées texte, image et vidéo et son accès gratuit ont rapidement attiré les développeurs d’agents de programmation.
Les premiers résultats DeepSWE à 80 % provenaient d’un échantillon de seulement 10 tâches ; les évaluations plus larges, autour de 58 à 63 %, le rapprochent davantage de Claude Opus 4.8 qu’ils ne prouvent une supérior...