原生多模態將視覺放入代理人嘅核心迴圈:Kimi K3 同 Qwen3.8 Max 可讓 AI 寫完程式後渲染、睇畫面、找錯再改,而唔係只靠文字描述。 Kimi K3 喺 Arena Frontend Code Arena 獲 1,679 分、排名第一;Qwen3.8 Max 則明確表示原生視覺理解貫穿規劃、執行同驗證。
研究答案

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
AI 模型之間愈來愈明顯嘅分野,已經唔係「可唔可以收圖片」咁簡單,而係圖片等視覺證據,有冇被當成代理人推理流程嘅一級資訊。
Moonshot AI 將 Kimi K3 定位為原生多模態、面向長期程式開發、知識工作、視覺理解及推理嘅代理模型;阿里巴巴則稱 Qwen3.8-Max 嘅視覺理解會貫穿規劃、執行同驗證。 17
35 實際目標好直接:叫 AI 做一個網頁或介面後,佢可以自己睇渲染結果、發現邊度唔對路,再改返好;而唔使每次都先將畫面壓縮成一份文字報告。
文字優先嘅通用模型仍然非常有用,尤其係寫程式、處理超長文件、呼叫工具,以及輸入同成功標準本身已經以文字表達嘅工作。一般工具型架構下,代理人可以叫 OCR 抽取文字、讀取 DOM 或無障礙樹、索取座標,或者將截圖交畀另一個視覺語言模型(VLM)分析。若工作只係抽文件資料、檢視結構化介面狀態,或者問一次性視覺問題,呢種拆件做法可以好合理。
原生多模態訓練係另一種取向:目標係讓文字、圖片、影片、程式碼同代理狀態一齊影響模型,令視覺資料直接參與規劃同修訂。有報道形容,Moonshot、阿里巴巴同字節跳動正朝呢個方向走;而當時 DeepSeek、智譜同騰訊混元嘅通用型發布則相對偏文字。 15
不過,呢個唔應該被理解成各間公司永久不變嘅分野。DeepSeek 嘅 V4 Flash 同 V4 Pro 起初只支援文字,但之後已推出實驗性質嘅 DeepSeek-V4-Flash-Vision-Exp。 13
4 模型產品線變得非常快,而現有資料亦不足以斷言每間實驗室——特別係字節跳動、智譜同騰訊——背後嘅具體內部策略。
一個網頁唔只得文字同 DOM 結構。層次、留白、對齊、對比度、字體、元素有冇被裁走、圖片,以及不同元素之間嘅關係,全部都係畫面的一部分。對要還原參考設計嘅代理人而言,呢啲細節往往先至係真正嘅驗收標準。
一個有視覺回饋嘅工作流程,大概會係:
Qwen3.8-Max 明確描述咗呢個閉環:原生視覺理解會用喺規劃、執行及驗證,支援長時程任務;其託管模型接受圖片、文字同影片輸入,輸出則為文字。 35 Kimi K3 同樣喺一個模型內理解文字、圖片及影片,並支援 100 萬 token 上下文視窗。
25
優勢唔單止係「模型睇到」。真正關鍵係,同一個代理人可以喺反覆改進期間,同時保留要求、程式碼、視覺輸出同不斷更新嘅計劃。
外接感知工具好多時都好有效,但佢哋喺「睇」同「做」之間加咗一層介面。
OCR 抽取得好選擇性。 佢可以攞到畫面上嘅字,但單靠文字未必講得清按鈕有冇被截斷、版面係咪失衡、彈窗有冇遮住內容,或者視覺層次係咪同參考圖唔一致。
座標資料有結構,但資訊窄。 「元素喺 x/y 位置」對自動化好有用,但未必反映到視覺重要性、樣式、重疊關係,亦未必知道嗰個元素係咪畫面上真正要搵嘅對象。
多次轉譯會令長鏈任務更複雜。 每一次由截圖轉描述、或由截圖轉座標,都可能丟失語境,令代理人要重新拼湊畫面。根據一個唔完整描述去改 CSS,可能又整出另一個視覺問題,於是又要再睇、再轉譯、再修。
原生多模態唔代表一定唔會出錯;不過,佢可以將截圖同實作內容放埋一齊推理,而唔係淨係靠截圖嘅文字摘要。呢個正正係前端開發、GUI 自動化、視覺回歸除錯、圖片編輯同影片工作流程特別重視佢嘅原因。
Kimi K3 嘅公開結果說明咗,點解開發者愈來愈關心呢類能力。Arena 指 Kimi K3 以 1,679 分登上 Frontend Code Arena 第一位,較 Kimi K2.6 上升 17 位;列出嘅七個前端範疇中,佢喺六個排第一。 32 另外,有報道指瀏覽器開發平台 Puter 做測試時,特登喺網站加入五個視覺差異;Kimi K3 將目標頁面同渲染版本嘅截圖作比較,找出全部五項差異,而且冇誤報。
28
呢啲都係視覺驗證能力嘅有力示範,但唔能夠單憑此斷定「原生視覺」本身就係全部原因。模型規模、訓練資料、後訓練、提示設計、瀏覽器工具、代理框架同基準測試設計,都可以影響成績。比較穩妥嘅結論係:視覺回饋確實能處理一類純文字測試容易漏掉嘅問題。
如果任務需要反覆觀察同修改,而且「畫面啱唔啱」本身就係完成定義,原生多模態會更值得優先考慮:
相反,若只求低成本抽取資料、批量處理,或者流程只需要結構化文字同 UI 狀態,模組化 OCR 或外接 VLM 方案仍然可能更合適。
最重要唔係視覺功能潮唔潮,而係代理人係咪需要不斷回答同一條問題:「呢個輸出,睇落真係啱未?」
對呢類工作,原生多模態將感知由偶爾一次工具呼叫,變成代理人日常運作嘅一部分——而 Kimi K3 同 Qwen3.8-Max 正正明確朝住呢個方向發展。 17
35
Studio Global AI
此頁麵包含一個有來源支援的答案,您可以在 Studio Global 內繼續。
原生多模態將視覺放入代理人嘅核心迴圈:Kimi K3 同 Qwen3.8 Max 可讓 AI 寫完程式後渲染、睇畫面、找錯再改,而唔係只靠文字描述。
原生多模態將視覺放入代理人嘅核心迴圈:Kimi K3 同 Qwen3.8 Max 可讓 AI 寫完程式後渲染、睇畫面、找錯再改,而唔係只靠文字描述。 Kimi K3 喺 Arena Frontend Code Arena 獲 1,679 分、排名第一;Qwen3.8 Max 則明確表示原生視覺理解貫穿規劃、執行同驗證。