Nativní multimodalita staví vizuální vnímání přímo do pracovního cyklu agenta: Kimi K3 a Qwen3.8 Max mohou v jednom procesu plánovat, vytvářet, vykreslit, zkontrolovat a upravit výsledek. Kimi K3 dosáhl 1 679 bodů a prvního místa ve Frontend Code Arena; Qwen3.8 Max popisuje využití obrazu napříč plánováním, prováděn...
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Rozdíl mezi špičkovými modely už nespočívá jen v tom, zda dokážou přijmout obrázek. Podstatnější je, zda se obraz stává plnohodnotnou součástí uvažování agenta — tedy zda může ovlivňovat jeho plán, prováděné kroky i následnou kontrolu výsledku.
Moonshot AI prezentuje Kimi K3 jako nativně multimodální agentní model pro dlouhé kódovací úlohy, znalostní práci, vizuální porozumění a reasoning. Alibaba u Qwen3.8-Max uvádí vizuální porozumění napříč plánováním, prováděním a ověřováním. 17
35 Praktický smysl je jednoduchý: agent něco vytvoří, uvidí vykreslený výsledek, rozpozná problém a opraví jej — aniž by se každé vizuální zjištění muselo nejdřív převést do stručného textového hlášení.
Textově orientované modely jsou nadále velmi užitečné pro generování kódu, analýzu dlouhého kontextu, volání nástrojů i úlohy, kde jsou vstup i kritéria úspěchu už vyjádřeny textem. Agent může v běžném nástrojovém řešení spustit OCR, prohlédnout DOM či strom přístupnosti, vyžádat si souřadnice prvků nebo předat snímek obrazovky samostatnému modelu pro práci s obrazem. Pro vytěžování dokumentů, strukturovanou kontrolu uživatelského rozhraní nebo jednorázový vizuální dotaz to může být rozumná architektura.
Nativní multimodální trénování sází na něco jiného: na společné zpracování textu, obrázků, videa, kódu a stavu agenta tak, aby vizuální informace přímo ovlivňovaly plánování i revize. Zpráva o čínském trhu modelů tímto směrem řadila Moonshot, Alibabu a ByteDance, zatímco tehdejší obecně zaměřené modely od DeepSeeku, Zhipu a Hunyuan byly relativně více textové. 15
Nejde však o trvalé rozdělení laboratoří na dva tábory. DeepSeek V4 Flash a V4 Pro původně podporovaly jen text, DeepSeek ale následně představil experimentální model DeepSeek-V4-Flash-Vision-Exp. 13
4 Nabídky modelů se rychle mění a dostupné zdroje nedokládají jednoznačné interní důvody rozhodnutí jednotlivých firem — zvlášť u ByteDance, Zhipu a Tencentu.
Webová stránka není jen soubor slov a struktura DOM. Tvoří ji také hierarchie, prázdné místo, zarovnání, kontrast, typografie, ořezání prvků, obrazový obsah a vztahy mezi komponentami. Pokud má agent napodobit referenční návrh, právě tyto vlastnosti často rozhodují o tom, zda je úkol hotový.
Pracovní postup s vizuální zpětnou vazbou může vypadat takto:
Qwen3.8-Max tento uzavřený cyklus popisuje výslovně: nativní vizuální porozumění používá při plánování, provádění i ověřování dlouhodobých úloh. Hostovaná verze přijímá obrázky, text a video, výstupem je text. 35 Kimi K3 obdobně pracuje s textem, obrázky a videem v rámci jediného modelu a má kontextové okno o velikosti 1 milionu tokenů.
25
Výhoda tedy není pouze v tom, že model „vidí“. Tentýž agent může při opakovaných úpravách udržet pohromadě zadání, kód, vizuální výsledek i průběžně se měnící plán.
Externí nástroje pro vnímání mohou fungovat dobře, vytvářejí však rozhraní mezi tím, co agent vidí, a tím, co dělá.
OCR zachytí jen část informace. Dokáže vytěžit viditelný text, ale samotný přepis slov neříká dost o tom, zda je tlačítko oříznuté, kompozice nevyvážená, dialog překrývá obsah nebo se vizuální hierarchie liší od předlohy.
Souřadnice jsou přesné, ale úzké. Informace typu „prvek je na pozici x/y“ pomáhá automatizaci. Nemusí však sdělit, jak je prvek vizuálně výrazný, jak je stylovaný, zda se nepřekrývá s jiným prvkem ani zda jde skutečně o správný objekt.
Při dlouhém řetězci kroků se ztráty kumulují. Každé předání od snímku k popisu či souřadnicím může odebrat kontext nebo přinutit agenta, aby jej znovu skládal. Oprava podle neúplného popisu pak může vyvolat další vizuální chybu — a další kolo pozorování.
Nativně multimodální model tím chyby neodstraní. Může ale pracovat se snímkem obrazovky a kontextem implementace společně, namísto aby se spoléhal jen na textové shrnutí obsahu snímku. To je důležité hlavně pro vývoj front-endu, automatizaci grafických rozhraní, hledání vizuálních regresí, úpravu obrázků a video pracovní postupy.
Veřejné výsledky Kimi K3 ilustrují, proč vývojáři vizuální zpětné vazbě věnují pozornost. Arena uvedla, že Kimi K3 vedl Frontend Code Arena s 1 679 body, což znamenalo posun o 17 míst oproti Kimi K2.6; v šesti ze sedmi uvedených oblastí front-endu byl první. 32 Samostatné zpravodajství o testu platformy Puter uvádí, že Kimi K3 bez falešně pozitivního nálezu odhalil pět záměrně vložených vizuálních odchylek mezi cílovou stránkou a její vykreslenou verzí.
28
Jde o relevantní ukázky vizuálního ověřování. Neprokazují ale, že výsledky způsobilo výhradně nativní vidění. Roli může hrát velikost modelu, trénovací data, dolaďování, formulace zadání, nástroje pro prohlížeč, agentní architektura i samotná podoba benchmarku. Přiměřenější závěr je užší: vizuální zpětná vazba řeší skutečnou skupinu selhání, které textové testy nemusí zachytit.
Nativně multimodální agent dává největší smysl, když úloha vyžaduje opakované pozorování a revize a vizuální věrnost patří do definice hotového výsledku:
Modulární pipeline s OCR nebo externím modelem pro obraz může být stále vhodnější pro levné vytěžování dat, dávkové zpracování nebo procesy, které potřebují jen strukturovaný text a stav uživatelského rozhraní. Rozhodující otázkou není, zda je vidění v AI módní. Je jí toto: musí agent opakovaně ověřovat, že výsledek opravdu vypadá správně?
Pro tento typ práce nativní multimodalita mění vnímání z občasného volání nástroje na součást pracovního cyklu agenta — směr, který Kimi K3 a Qwen3.8-Max výslovně sledují. 17
35
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Nativní multimodalita staví vizuální vnímání přímo do pracovního cyklu agenta: Kimi K3 a Qwen3.8 Max mohou v jednom procesu plánovat, vytvářet, vykreslit, zkontrolovat a upravit výsledek.
Nativní multimodalita staví vizuální vnímání přímo do pracovního cyklu agenta: Kimi K3 a Qwen3.8 Max mohou v jednom procesu plánovat, vytvářet, vykreslit, zkontrolovat a upravit výsledek. Kimi K3 dosáhl 1 679 bodů a prvního místa ve Frontend Code Arena; Qwen3.8 Max popisuje využití obrazu napříč plánováním, prováděním i ověřováním.