编程智能体之间正在出现一个更关键的差别:并非单纯比较模型是否可以接收图片,而是比较视觉信息是否被当作推理与行动循环中的一等信息。
月之暗面(Moonshot AI)的 Kimi K3 被定位为面向长程编程、知识工作、视觉理解和推理的原生多模态智能体模型;阿里云则称,Qwen3.8-Max 的原生视觉理解贯穿规划、执行和验证。
17
35 对开发者而言,这意味着智能体可以自己写代码、渲染结果、查看页面,再定位问题并持续改进,而不必每次先把视觉观察压缩成一段文字报告。
关键分野:能补视觉,还是让视觉进入主循环
以文本为主的通用模型依然非常有用:代码生成、长上下文分析、工具调用,以及输入和验收标准都已用文字表达的工作,都很适合这类模型。在常见的工具链中,智能体可以调用 OCR(光学字符识别)、读取 DOM 或无障碍树、获取元素坐标,或者把截图交给独立的视觉语言模型处理。对于文档批量提取、结构化界面检查,或一次性的看图问答,这种架构可以很实用。
原生多模态选择的是另一条路线:在训练和后续优化中共同处理文本、图像、视频、代码与智能体状态,让视觉信息直接影响规划和修改。有关中国大模型市场的报道将月之暗面、阿里巴巴和字节跳动归入这一方向,同时认为当时 DeepSeek、智谱和腾讯混元的通用模型发布相对更偏文本。
15
不过,这不应被理解为各家公司永久、绝对的技术分界。DeepSeek V4 Flash 与 V4 Pro 最初只支持文本,但 DeepSeek 随后推出了实验性的 DeepSeek-V4-Flash-Vision-Exp。
13
4 模型产品线变化很快;现有资料也不足以证明每一家实验室的内部决策逻辑,尤其不能据此断言字节跳动、智谱或腾讯的长期路线。
“视觉在环”究竟改变了什么
网页并不等于页面上的文字和 DOM 结构。视觉成品还包含信息层级、留白、对齐、对比度、字体、裁切、图片,以及各元素之间的相互关系。对于复刻参考设计的任务,这些往往才是真正的验收标准。
一个将视觉纳入闭环的工作流,通常包括:
- 规划:理解需求、参考图、代码库和此前的任务状态;
- 执行:编写或修改代码,操作浏览器、应用,或编辑视觉素材;
- 观察:渲染结果,检查截图、视频帧或其他视觉输出;
- 验证与修订:把输出与目标对照,判断可能的缺陷,修改底层代码或素材,然后重复这一过程。
Qwen3.8-Max 对此有明确描述:其原生视觉理解用于规划、执行和验证,支持长程任务中的自主规划与闭环迭代。托管模型支持图像、文本和视频输入,并输出文本。
35 Kimi K3 同样可在同一模型中理解文本、图像和视频,并支持 100 万 token 上下文窗口。
25
优势不只是“模型看得见”,而是同一个智能体能在不断迭代时,持续保留需求、代码、视觉结果和执行计划之间的关联。
为什么 OCR 与外部视觉模型交接会受限
外部感知工具并非无效,但它们在“看见”与“行动”之间增加了一层接口。
- OCR 具有选择性。 它能提取可见文字,却无法完整表达按钮是否被裁切、布局是否失衡、弹窗是否遮挡内容,或视觉层级是否与参考图一致。
- 坐标信息结构化,但表达范围有限。 “元素位于 x/y 坐标”有利于自动化操作,却未必能说明该元素是否醒目、样式是否正确、是否发生重叠,或它是不是用户真正看到的那个对象。
- 多次转译会增加长链任务的负担。 每一次“截图转描述”或“截图转坐标”,都可能丢失上下文,迫使智能体重新拼接理解。一项基于不完整描述的修复,可能又引入新的视觉问题,从而再次进入观察循环。
原生多模态模型当然也会出错,但它可以同时结合截图、实现代码和任务上下文进行判断,而非仅依赖截图的文本摘要。这也是它在前端开发、GUI 自动化、视觉回归排错、图像编辑和视频工作流中更具吸引力的原因。
Kimi K3 展示了应用价值,但不能据此断言因果
Kimi K3 的公开结果说明了开发者为何重视视觉验证。Arena 报告称,Kimi K3 以 1,679 分位居 Frontend Code Arena 第一,较 Kimi K2.6 上升 17 位;在列出的 7 个前端领域中,它有 6 项排名第一。
32 另有报道提到,浏览器开发平台 Puter 在网页中人为植入 5 处视觉差异后,Kimi K3 通过对比目标页面与渲染页面的截图,识别出全部 5 处差异,且没有误报。
28
这些案例是视觉验证能力的有力展示,但并不能证明结果完全由原生视觉单独造成。模型规模、训练数据、后训练方法、提示词设计、浏览器工具、智能体脚手架以及基准测试本身,都会影响最终表现。更稳妥的结论是:视觉反馈能覆盖一类文本测试容易遗漏的真实问题。
哪些任务值得优先选择原生多模态
如果任务需要反复观察和修订,而且“视觉是否正确”本身就是完成标准,原生多模态智能体更值得优先考虑,例如:
- 按参考设计还原网页或应用界面;
- 修复异常的 GUI 状态;
- 检查响应式布局和视觉回归问题;
- 编辑图像时保持主体、构图或风格约束;
- 审阅长视频,关注跨场景与跨帧的连贯性。
但对于低成本的批量抽取,或只需要结构化文字和界面状态的流程,模块化 OCR 或外部视觉模型方案仍可能更合适。真正应问的不是“视觉是否流行”,而是智能体是否必须反复回答一个问题:这个输出看起来真的对吗?
对这类工作而言,原生多模态让感知不再只是偶尔调用的工具,而成为智能体运行闭环的一部分——这正是 Kimi K3 与 Qwen3.8-Max 明确押注的方向。
17
35