Indbygget multimodalitet gør syn til en del af agentens planlægning, udførelse og kontrol: Kimi K3 og Qwen3.8 Max kan arbejde med tekst, billeder og video i lange opgaveforløb. Kimi K3 nåede 1.679 point og førstepladsen i Arena’s Frontend Code Arena, mens en Puter test viste, at modellen fandt fem bevidst indførte v...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
En afgørende forskel mellem de mest avancerede AI-modeller handler ikke kun om, hvorvidt de kan modtage et billede. Den handler om, hvorvidt visuelle oplysninger indgår direkte i agentens løbende tænkning, handlinger og kontrol.
Moonshot AI beskriver Kimi K3 som en indbygget multimodal agentmodel til langvarig kodning, vidensarbejde, visuel forståelse og ræsonnement. Alibaba beskriver tilsvarende, at Qwen3.8-Max bruger visuel forståelse gennem planlægning, udførelse og verificering. 17
35
Målet er praktisk: Agenten skal kunne bygge noget, se det renderede resultat, opdage hvad der ser forkert ud og forbedre det – uden først at skulle reducere hver skærm eller video-frame til en tekstlig mellemrapport.
Tekstfokuserede modeller er fortsat meget nyttige til kodegenerering, lange dokumenter, værktøjskald og opgaver, hvor både input og succeskriterier allerede er formuleret som tekst. En agent kan for eksempel kalde OCR, læse en DOM eller et accessibility tree, hente koordinater eller sende et skærmbillede til en særskilt vision-language-model.
Det kan være en fornuftig arkitektur ved dokumentudtræk, struktureret inspektion af brugerflader eller enkelte visuelle spørgsmål.
Indbygget multimodal træning satser på noget andet: at tekst, billeder, video, kode og agentens tilstand kan behandles sammen, så visuelle indtryk påvirker planlægning og rettelser direkte. En gennemgang af det kinesiske modelmarked pegede på Moonshot, Alibaba og ByteDance som aktører med denne retning, mens DeepSeek, Zhipu og Tencents Hunyuan-modeller på det tidspunkt var mere tekstcentrerede. 15
Det er dog et øjebliksbillede – ikke en permanent opdeling mellem virksomheder. DeepSeek V4 Flash og V4 Pro understøttede oprindeligt kun tekst, men DeepSeek lancerede senere den eksperimentelle DeepSeek-V4-Flash-Vision-Exp. 13
4 Modeludvalg ændrer sig hurtigt, og de tilgængelige kilder forklarer ikke de interne strategiske valg hos hver enkelt virksomhed.
En webside er mere end ord og DOM-struktur. Den består også af hierarki, luft, justering, kontrast, typografi, beskæring, billeder og forholdet mellem elementerne. Når en agent skal ramme et referencedesign, er det ofte netop disse ting, der afgør, om opgaven er løst.
En arbejdsgang med syn i løkken kan se sådan ud:
Qwen3.8-Max beskriver eksplicit denne lukkede løkke, hvor indbygget visuel forståelse bruges i planlægning, udførelse og verificering ved langvarige opgaver. Den hostede model tager billeder, tekst og video som input og leverer tekst som output. 35 Kimi K3 forstår på samme måde tekst, billeder og video i én model og har et kontekstvindue på 1 million tokens.
25
Fordelen er altså ikke bare, at modellen "kan se". Det er, at den samme agent kan bevare opgaven, koden, det visuelle resultat og den aktuelle plan i samme arbejdskontekst, mens den itererer.
Eksterne perceptionsværktøjer kan være effektive, men de indfører et led mellem det, agenten ser, og det, den gør.
OCR er selektivt. Det kan udtrække synlig tekst, men fortæller ikke nødvendigvis, om en knap er afskåret, et layout er i ubalance, en modal dækker vigtigt indhold, eller det visuelle hierarki afviger fra referencen.
Koordinater er præcise, men smalle. Oplysningen om, at et element ligger på bestemte x/y-koordinater, kan være nyttig til automatisering. Men den siger ikke nødvendigvis noget om visuel vægt, styling, overlap eller om det faktisk er det rigtige element set med brugerens øjne.
Gentagne oversættelser kan svække lange forløb. Ved mange trin kan hver overlevering fra skærmbillede til tekstbeskrivelse eller koordinater koste kontekst. Hvis agenten retter ud fra en ufuldstændig beskrivelse, kan den skabe en ny visuel fejl og kræve endnu en kontrolrunde.
En indbygget multimodal model er naturligvis ikke fejlfri. Men den kan ræsonnere over skærmbilledet og implementeringen samtidigt frem for kun at basere sig på en tekstlig opsummering af det visuelle indhold. Det er særligt relevant ved frontend-udvikling, GUI-automatisering, fejlsøgning af visuelle regressioner, billedredigering og videoforløb.
Kimi K3’s offentlige resultater illustrerer, hvorfor udviklere følger denne type modeller tæt. Arena rapporterede, at Kimi K3 nåede førstepladsen i Frontend Code Arena med 1.679 point – en fremgang på 17 pladser fra Kimi K2.6 – og blev nummer ét i seks af syv frontend-kategorier. 32
I en separat omtalt Puter-test fandt Kimi K3 fem bevidst indførte visuelle forskelle mellem en målwebside og en renderet version uden falske positiver. 28
Det er relevante demonstrationer af visuel verificering, men de beviser ikke, at indbygget syn alene skabte resultaterne. Modelstørrelse, træningsdata, eftertræning, prompts, browserværktøjer, agentrammeværk og selve benchmarkdesignet kan også spille ind.
Den mere forsigtige konklusion er, at visuel feedback kan fange en reel type fejl, som rene tekstbaserede tests overser.
En indbygget multimodal agent er særligt relevant, når opgaven kræver gentagen observation og revision, og når visuel kvalitet er en del af definitionen på færdig:
En modulær pipeline med OCR eller en ekstern synsmodel kan stadig være bedre og billigere til batchudtræk, engangsanalyser eller processer, der kun kræver struktureret tekst og UI-tilstand.
Det afgørende spørgsmål er derfor ikke, om syn i AI er moderne. Det er, om agenten igen og igen skal kunne afgøre: Ser resultatet faktisk rigtigt ud?
Når svaret er ja, gør indbygget multimodalitet perception til en del af agentens normale arbejdsløkke frem for et lejlighedsvist værktøjskald – en retning, som Kimi K3 og Qwen3.8-Max eksplicit forfølger. 17
35
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Indbygget multimodalitet gør syn til en del af agentens planlægning, udførelse og kontrol: Kimi K3 og Qwen3.8 Max kan arbejde med tekst, billeder og video i lange opgaveforløb.
Indbygget multimodalitet gør syn til en del af agentens planlægning, udførelse og kontrol: Kimi K3 og Qwen3.8 Max kan arbejde med tekst, billeder og video i lange opgaveforløb. Kimi K3 nåede 1.679 point og førstepladsen i Arena’s Frontend Code Arena, mens en Puter test viste, at modellen fandt fem bevidst indførte visuelle afvigelser uden falske positiver.