Native multimodaliteit is een productkeuze voor visuele agenten: Kimi K3 en Qwen3.8 Max combineren beeldbegrip met langetermijnredeneren, zodat een agent werk kan renderen, controleren en verbeteren in één cyclus. Kimi K3 behaalde 1.679 punten en de eerste plaats in Arena’s Frontend Code Arena; Qwen3.8 Max beschrijf...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
De groeiende kloof tussen geavanceerde AI-modellen draait niet alleen om de vraag of een systeem een afbeelding kan ontvangen. Belangrijker is of visuele informatie een volwaardig onderdeel is van de redeneer- en handelingscyclus van een agent.
Moonshot AI positioneert Kimi K3 als een native multimodaal, agentisch model voor langdurige programmeertaken, kenniswerk, visueel begrip en redeneren. Alibaba stelt dat Qwen3.8-Max beeldbegrip inzet tijdens planning, uitvoering én verificatie. 17
35 Het praktische doel is helder: een agent moet iets kunnen bouwen, het gerenderde resultaat kunnen bekijken, zien wat er niet klopt en het vervolgens verbeteren — zonder elke visuele observatie eerst te reduceren tot een tekstueel tussenrapport.
Tekstgerichte algemene modellen zijn nog altijd zeer bruikbaar voor codegeneratie, analyse van lange contexten, toolgebruik en taken waarvan zowel de invoer als de succescriteria al in tekst zijn vastgelegd. In een klassieke opzet kan een agent OCR aanroepen, een DOM- of toegankelijkheidsboom uitlezen, coördinaten opvragen of een screenshot naar een apart vision-language model (VLM) sturen. Dat kan prima werken voor documentextractie, gestructureerde interface-inspectie of een eenmalige visuele vraag.
Native multimodale training kiest voor een andere inzet. Daarbij worden tekst, afbeeldingen, video, code en agentstatus gezamenlijk verwerkt, zodat visuele informatie rechtstreeks kan meewegen in planning en revisie. Berichtgeving over de Chinese modellenmarkt beschreef Moonshot, Alibaba en ByteDance als partijen die deze richting kiezen, terwijl de algemene releases van DeepSeek, Zhipu en Hunyuan op dat moment relatief tekstgericht waren. 15
Dat is geen blijvende, harde scheidslijn tussen bedrijven. DeepSeek V4 Flash en V4 Pro ondersteunden aanvankelijk alleen tekst, maar DeepSeek bracht later het experimentele DeepSeek-V4-Flash-Vision-Exp uit. 13
4 Modellijnen veranderen snel. De beschikbare bronnen geven bovendien geen definitieve verklaring voor de interne keuzes van elk lab, vooral niet voor ByteDance, Zhipu en Tencent.
Een webpagina bestaat uit meer dan woorden en DOM-structuur. Ook hiërarchie, witruimte, uitlijning, contrast, typografie, afgesneden elementen, beeldmateriaal en de onderlinge relatie tussen onderdelen bepalen het resultaat. Voor een agent die een referentieontwerp moet nabouwen, zijn juist die details vaak de echte acceptatiecriteria.
Een workflow met beeld in de lus kan er als volgt uitzien:
Qwen3.8-Max beschrijft expliciet zo’n gesloten lus: native beeldbegrip wordt gebruikt tijdens planning, uitvoering en verificatie bij taken met een lange looptijd. Het gehoste model accepteert afbeeldingen, tekst en video als invoer en geeft tekst als uitvoer. 35 Kimi K3 ondersteunt eveneens begrip van tekst, afbeeldingen en video binnen één model, met een contextvenster van 1 miljoen tokens.
25
Het voordeel is dus niet alleen dat het model kan ‘zien’. Dezelfde agent kan opdracht, code, visuele uitvoer en het steeds veranderende plan bij elkaar houden terwijl hij iteratief verbetert.
Externe waarnemingstools zijn vaak effectief, maar ze plaatsen een grensvlak tussen waarnemen en handelen.
OCR is selectief. Het kan zichtbare woorden uitlezen, maar tekstextractie vertelt niet volledig of een knop is afgesneden, een lay-out uit balans is, een modaal venster inhoud bedekt of de visuele hiërarchie afwijkt van de referentie.
Coördinaten zijn gestructureerd, maar beperkt. Een melding als ‘element op x/y’ is nuttig voor automatisering, maar zegt niet per se iets over opvallendheid, vormgeving, overlap of de vraag of het visueel wel om het juiste object gaat.
Herhaalde vertaling maakt lange ketens ingewikkelder. Bij een workflow met veel stappen kan elke omzetting van screenshot naar beschrijving of coördinaten context verliezen. De agent moet die context vervolgens opnieuw reconstrueren. Een patch op basis van een onvolledige beschrijving kan weer een nieuw visueel probleem veroorzaken, waarna nog een observatieronde nodig is.
Een native multimodaal model voorkomt fouten niet volledig, maar kan wel tegelijk redeneren over het screenshot en de implementatiecontext, in plaats van uitsluitend te steunen op een tekstuele samenvatting van wat er op het scherm staat. Dat is aantrekkelijk voor front-endontwikkeling, GUI-automatisering, debugging van visuele regressies, beeldbewerking en videoworkflows.
De publieke resultaten van Kimi K3 illustreren waarom ontwikkelaars hier aandacht aan besteden. Arena meldde dat Kimi K3 met 1.679 punten bovenaan stond in de Frontend Code Arena: een sprong van 17 plaatsen ten opzichte van Kimi K2.6. Het model stond eerste in zes van de zeven genoemde front-enddomeinen. 32 Afzonderlijke berichtgeving over een test van Puter stelde dat Kimi K3 vijf bewust aangebrachte visuele afwijkingen vond tussen een doelwebpagina en een gerenderde versie, zonder fout-positieven.
28
Dat zijn relevante demonstraties van visuele verificatie. Ze bewijzen echter niet dat native vision alléén deze prestaties veroorzaakte. Ook modelomvang, trainingsdata, post-training, promptontwerp, browsertools, agentarchitectuur en de benchmark zelf kunnen een rol spelen. De voorzichtigere conclusie is: visuele feedback pakt een reële categorie fouten aan die tekstuele tests kunnen missen.
Kies bij voorkeur voor een native multimodale agent wanneer de taak herhaald waarnemen en bijsturen vereist, en visuele nauwkeurigheid onderdeel is van de definitie van ‘klaar’:
Een modulaire pipeline met OCR of een extern VLM kan nog altijd de betere keuze zijn voor goedkope extractie, batchverwerking of processen die uitsluitend gestructureerde tekst en interfacestatus nodig hebben. De kernvraag is niet of vision hip is, maar of de agent herhaaldelijk een visuele vraag moet beantwoorden: ziet deze uitvoer er daadwerkelijk goed uit?
Voor dat soort werk verandert native multimodaliteit waarneming van een incidentele toolaanroep in een vast onderdeel van de agentcyclus — een richting die Kimi K3 en Qwen3.8-Max expliciet nastreven. 17
35
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Native multimodaliteit is een productkeuze voor visuele agenten: Kimi K3 en Qwen3.8 Max combineren beeldbegrip met langetermijnredeneren, zodat een agent werk kan renderen, controleren en verbeteren in één cyclus.
Native multimodaliteit is een productkeuze voor visuele agenten: Kimi K3 en Qwen3.8 Max combineren beeldbegrip met langetermijnredeneren, zodat een agent werk kan renderen, controleren en verbeteren in één cyclus. Kimi K3 behaalde 1.679 punten en de eerste plaats in Arena’s Frontend Code Arena; Qwen3.8 Max beschrijft beeldbegrip als onderdeel van planning, uitvoering en verificatie.