La multimodalité native place l’image, la vidéo et le texte dans une même boucle de travail : l’agent peut produire, rendre, inspecter puis corriger son résultat. Kimi K3 a atteint 1 679 points et la première place de Frontend Code Arena ; Qwen3.8 Max indique utiliser la vision lors de la planification, de l’exécuti...
Réponse de recherche

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
L’enjeu ne consiste plus seulement à savoir si un modèle peut recevoir une image. La vraie différence est de savoir si l’information visuelle participe pleinement au raisonnement d’un agent, tout au long de son travail.
Moonshot AI présente Kimi K3 comme un modèle agentique multimodal natif destiné au code sur de longues séquences, au travail de connaissance, à la compréhension visuelle et au raisonnement. Alibaba indique de son côté que la compréhension visuelle de Qwen3.8-Max intervient lors de la planification, de l’exécution et de la vérification. 17
35
L’objectif est concret : permettre à un agent de créer une interface, d’en observer le rendu, de détecter ce qui ne va pas et de le corriger, sans devoir convertir chaque observation visuelle en simple compte rendu textuel.
Les modèles généralistes centrés sur le texte restent très utiles pour générer du code, analyser de longs contextes, appeler des outils ou traiter des tâches dont les entrées et les critères de réussite sont déjà formulés en texte. Dans une architecture outillée classique, un agent peut appeler un outil d’OCR, examiner le DOM ou l’arbre d’accessibilité, demander des coordonnées ou envoyer une capture d’écran à un modèle vision-langage distinct.
Cette organisation peut convenir à l’extraction documentaire, à l’inspection structurée d’une interface ou à une question visuelle ponctuelle.
La multimodalité native fait un pari différent : traiter conjointement texte, images, vidéo, code et état de l’agent, afin que le visuel puisse influencer directement la planification et les révisions. Des analyses du marché chinois des modèles ont décrit Moonshot, Alibaba et ByteDance comme engagés dans cette direction, alors que les sorties généralistes de DeepSeek, Zhipu et Hunyuan étaient alors davantage centrées sur le texte. 15
Il ne faut toutefois pas y voir une frontière définitive entre entreprises. DeepSeek V4 Flash et V4 Pro ne prenaient initialement en charge que le texte, mais DeepSeek a ensuite lancé le modèle expérimental DeepSeek-V4-Flash-Vision-Exp. 13
4 Les catalogues évoluent rapidement, et les sources disponibles ne permettent pas d’établir les motivations internes précises de chaque laboratoire, notamment pour ByteDance, Zhipu et Tencent.
Une page web ne se réduit ni à ses mots ni à sa structure DOM. Elle comprend aussi la hiérarchie visuelle, les espacements, les alignements, les contrastes, la typographie, les éléments rognés, les images et les relations entre composants. Lorsqu’un agent doit reproduire une maquette, ce sont souvent ces détails qui déterminent si le travail est réellement terminé.
Un cycle de travail fondé sur la vision peut suivre quatre étapes :
Qwen3.8-Max décrit explicitement ce fonctionnement en boucle fermée : sa compréhension visuelle native est utilisée de la planification à la vérification pour les tâches de longue durée. Le modèle hébergé accepte des images, du texte et de la vidéo en entrée, et produit du texte en sortie. 35 Kimi K3 comprend lui aussi le texte, les images et la vidéo dans un même modèle, avec une fenêtre de contexte d’un million de tokens.
25
L’avantage ne se résume donc pas à « le modèle voit ». Le même agent peut conserver simultanément la demande, le code, le rendu visuel et son plan de travail à mesure qu’il itère.
Les outils de perception externes peuvent être efficaces, mais ils ajoutent une interface entre le fait de voir et le fait d’agir.
L’OCR est sélectif. Il extrait les mots visibles, mais ne restitue pas à lui seul un bouton coupé, une mise en page déséquilibrée, une fenêtre modale qui masque le contenu ou une hiérarchie visuelle différente de la référence.
Les coordonnées sont structurées, mais partielles. Savoir qu’un élément se situe à telle position x/y aide à automatiser une action. Cela ne dit pas toujours s’il est visuellement saillant, correctement stylé, recouvert par un autre élément ou même s’il s’agit du bon objet à examiner.
Les traductions répétées compliquent les longues chaînes d’action. À chaque passage d’une capture à une description ou à des coordonnées, du contexte peut être perdu et l’agent doit parfois le reconstituer. Un correctif fondé sur une description incomplète peut créer un nouveau défaut visuel, imposant un autre cycle d’observation.
Un modèle multimodal natif ne supprime pas les erreurs. Il peut en revanche raisonner sur la capture et le contexte d’implémentation ensemble, plutôt que de dépendre uniquement d’un résumé textuel de l’image. C’est l’intérêt central pour le développement front-end, l’automatisation d’interfaces graphiques, le débogage de régressions visuelles, la retouche d’images ou les flux vidéo.
Les résultats publics de Kimi K3 montrent pourquoi les développeurs s’y intéressent. Arena a placé Kimi K3 en tête de Frontend Code Arena avec 1 679 points, soit un gain de 17 places par rapport à Kimi K2.6 ; le modèle s’est classé premier dans six des sept domaines front-end listés. 32 Par ailleurs, selon un test rapporté de la plateforme de développement dans le navigateur Puter, Kimi K3 a identifié cinq divergences visuelles introduites volontairement entre une page cible et son rendu, sans faux positif.
28
Ces démonstrations sont significatives pour la vérification visuelle. Elles ne prouvent pas, à elles seules, que la vision native est l’unique cause de ces résultats. La taille du modèle, les données et méthodes de post-entraînement, les prompts, les outils de navigation, l’architecture de l’agent et le benchmark peuvent tous peser sur les performances.
La conclusion la plus solide est donc plus limitée : le retour visuel couvre une catégorie réelle d’erreurs que des tests exclusivement textuels risquent de ne pas détecter.
Cette approche mérite d’être priorisée lorsque la tâche exige de multiples cycles d’observation et de correction, et que la fidélité visuelle fait partie de la définition du travail terminé :
Un pipeline modulaire associant OCR ou VLM externe peut rester mieux adapté à l’extraction peu coûteuse, au traitement par lots ou aux flux qui ne demandent que du texte structuré et l’état de composants d’interface.
La question décisive n’est pas de savoir si la vision est à la mode. C’est de déterminer si l’agent doit répondre, encore et encore, à cette question : « Est-ce que le résultat a réellement l’apparence attendue ? »
Pour ce type de tâche, la multimodalité native transforme la perception : elle n’est plus un appel d’outil occasionnel, mais devient une composante de la boucle opérationnelle de l’agent — une orientation que Kimi K3 et Qwen3.8-Max revendiquent explicitement. 17
35
Studio Global AI
Cette page comprend une réponse basée sur la source que vous pouvez continuer dans Studio Global.
La multimodalité native place l’image, la vidéo et le texte dans une même boucle de travail : l’agent peut produire, rendre, inspecter puis corriger son résultat.
La multimodalité native place l’image, la vidéo et le texte dans une même boucle de travail : l’agent peut produire, rendre, inspecter puis corriger son résultat. Kimi K3 a atteint 1 679 points et la première place de Frontend Code Arena ; Qwen3.8 Max indique utiliser la vision lors de la planification, de l’exécution et de la vérification.