Kimi K3 og Qwen3.8 Max er utviklet for å kombinere visuell forståelse med langsiktig resonnering, slik at agenten kan lage, gjengi, inspisere og forbedre arbeid i én sammenhengende løkke. Kimi K3 fikk 1 679 poeng og førsteplass i Arena Frontend Code Arena, mens Qwen3.8 Max beskriver syn som en del av planlegging, ut...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Det nye skillet mellom avanserte KI-modeller handler ikke først og fremst om hvorvidt en modell kan ta imot et bilde. Det viktigste er om visuelle inntrykk inngår som en sentral del av agentens resonnering mens den jobber.
Moonshot AI posisjonerer Kimi K3 som en innebygd multimodal agentmodell for langvarig programmering, kunnskapsarbeid, visuell forståelse og resonnering. Alibaba sier at Qwen3.8-Max bruker visuell forståelse i planlegging, utførelse og verifisering. 17
35 Målet er praktisk: Agenten skal kunne bygge en løsning, se det ferdige resultatet, oppdage hva som er galt og forbedre løsningen – uten at hvert visuelt inntrykk først må reduseres til en tekstlig rapport.
Tekstorienterte modeller er fortsatt svært nyttige til å skrive kode, analysere lange dokumenter, bruke verktøy og løse oppgaver der både inndata og suksesskriterier allerede er uttrykt i tekst. I et verktøybasert oppsett kan en agent hente ut tekst med OCR, lese DOM-en eller tilgjengelighetstreet, be om koordinater eller sende et skjermbilde til en separat visjon-språk-modell.
Det kan være en god arkitektur for dokumentuttrekk, strukturert UI-inspeksjon eller et enkelt visuelt spørsmål. Men innebygd multimodal trening bygger på en annen idé: tekst, bilder, video, kode og agenttilstand skal håndteres samlet, slik at synet kan påvirke både planen og neste revisjon direkte. I omtalen av det kinesiske modellmarkedet ble Moonshot, Alibaba og ByteDance beskrevet som aktører som satser på denne retningen, mens generelle utgivelser fra DeepSeek, Zhipu og Hunyuan på det tidspunktet var mer tekstsentrerte. 15
Dette er et øyeblikksbilde, ikke en varig grense mellom selskapene. DeepSeek V4 Flash og V4 Pro støttet opprinnelig bare tekst, men DeepSeek lanserte senere den eksperimentelle modellen DeepSeek-V4-Flash-Vision-Exp. 13
4 Modellserier endrer seg raskt, og kildene gir ikke grunnlag for bastante forklaringer på hvert selskaps interne produktvalg – særlig ikke for ByteDance, Zhipu og Tencent.
En nettside er mer enn teksten og strukturen i DOM-en. Den består også av visuelt hierarki, luft, justering, kontrast, typografi, elementer som kuttes av, bilder og samspillet mellom komponenter. Når oppgaven er å gjenskape et referansedesign, er dette ofte selve definisjonen på at resultatet er godt nok.
En arbeidsflyt med syn i løkken kan se slik ut:
Qwen3.8-Max beskriver eksplisitt en slik lukket arbeidsløkke, der visuell forståelse brukes gjennom planlegging, utførelse og verifisering i langvarige oppgaver. Den vertsbaserte modellen støtter bilder, tekst og video som inndata, med tekst som utdata. 35 Kimi K3 håndterer på sin side tekst, bilder og video i samme modell, med et kontekstvindu på én million tokens.
25
Fordelen er altså ikke bare at modellen «kan se». Den samme agenten kan beholde oppgaven, koden, det visuelle resultatet og den løpende planen i samme kontekst mens den itererer.
Eksterne verktøy for visuell tolkning kan fungere godt, men de legger et grensesnitt mellom det å se og det å handle.
OCR er selektivt. Verktøyet kan hente ut synlige ord, men tekst alene beskriver ikke nødvendigvis at en knapp er avkuttet, at siden er visuelt ubalansert, at en modal dekker innhold, eller at hierarkiet avviker fra referansen.
Koordinater er nyttige, men snevre. Informasjon som «elementet ligger på x/y» hjelper automatisering, men sier ikke alltid noe om visuell betydning, stil, overlapping eller om dette faktisk er riktig objekt i designet.
Mange oversettelser kan svekke lange arbeidskjeder. Hver overføring fra skjermbilde til beskrivelse eller koordinater kan miste kontekst. Dersom agenten retter kode ut fra en ufullstendig beskrivelse, kan den skape en ny visuell feil – og må begynne observasjonsrunden på nytt.
En innebygd multimodal modell er ikke feilfri, men kan vurdere skjermbildet og implementasjonskonteksten sammen, i stedet for å være avhengig av et rent tekstlig sammendrag av bildet. Det er særlig relevant for front-end-utvikling, GUI-automatisering, visuell regresjonstesting, bilderedigering og videoflyter.
Kimi K3s offentlige resultater illustrerer hvorfor utviklere følger med. Arena oppga at Kimi K3 toppet Frontend Code Arena med 1 679 poeng, en framgang på 17 plasser fra Kimi K2.6, og førsteplass i seks av sju oppførte front-end-kategorier. 32 I en separat omtale av en Puter-test ble det rapportert at Kimi K3 identifiserte fem bevisst innførte visuelle avvik mellom en målside og en rendert versjon, uten falske positiver.
28
Dette er relevante demonstrasjoner av visuell verifisering. Men de beviser ikke at innebygd syn alene forklarer resultatene. Modellstørrelse, treningsdata, ettertrening, prompter, nettleserverktøy, agentrammeverk og selve benchmarken kan alle påvirke utfallet. Den mer nøkterne konklusjonen er at visuell tilbakemelding kan fange opp en reell kategori feil som rene teksttester overser.
Prioriter en innebygd multimodal agent når oppgaven krever gjentatt observasjon og forbedring, og visuell kvalitet er en del av leveransen:
En modulær arbeidsflyt med OCR eller en ekstern visjon-språk-modell kan fortsatt være det beste valget for rimelig uttrekk i stor skala, eller når agenten bare trenger strukturert tekst og UI-tilstand. Spørsmålet er ikke om syn er moderne, men om agenten gjentatte ganger må kunne svare på dette: Ser resultatet faktisk riktig ut?
For den typen arbeid gjør innebygd multimodalitet persepsjon til en del av agentens vanlige arbeidsløp, ikke bare et sporadisk verktøykall. Det er retningen Kimi K3 og Qwen3.8-Max uttrykkelig følger. 17
35
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Kimi K3 og Qwen3.8 Max er utviklet for å kombinere visuell forståelse med langsiktig resonnering, slik at agenten kan lage, gjengi, inspisere og forbedre arbeid i én sammenhengende løkke.
Kimi K3 og Qwen3.8 Max er utviklet for å kombinere visuell forståelse med langsiktig resonnering, slik at agenten kan lage, gjengi, inspisere og forbedre arbeid i én sammenhengende løkke. Kimi K3 fikk 1 679 poeng og førsteplass i Arena Frontend Code Arena, mens Qwen3.8 Max beskriver syn som en del av planlegging, utførelse og verifisering.