Đa phương thức gốc là lựa chọn xây dựng tác tử có phản hồi thị giác: Kimi K3 và Qwen3.8 Max kết hợp khả năng nhìn với suy luận dài hạn để tạo vòng lặp lập trình, hiển thị, kiểm tra và chỉnh sửa. Kimi K3 đạt 1.679 điểm, đứng đầu Frontend Code Arena; Qwen3.8 Max cho biết năng lực thị giác được dùng xuyên suốt các bước...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: Why are Moonshot AI’s Kimi K3, Alibaba’s Qwen3.8-Max, and ByteDance’s Doubao-Seed-2.1 pursuing native multimodal training while DeepSeek, Zh. Article summary: The split is primarily a product and training bet: native multimodal models treat visual perception as part of the agent’s core reasoning-and-action loop, while text-first models optimize the cheaper, better-established . Topic tags: general, news, general web, documentation, academic. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
Khác biệt ngày càng rõ giữa các mô hình tiên phong không chỉ nằm ở việc mô hình có nhận ảnh đầu vào hay không. Điều quan trọng hơn là bằng chứng trực quan có được xem như một phần cốt lõi trong chu trình suy luận và hành động của tác tử AI hay chỉ là dữ liệu được chuyển qua một công cụ phụ trợ.
Kimi K3 của Moonshot AI được định vị là mô hình tác tử đa phương thức gốc cho lập trình dài hạn, công việc tri thức, hiểu hình ảnh và suy luận. Alibaba mô tả Qwen3.8-Max dùng năng lực hiểu thị giác trong toàn bộ các bước lập kế hoạch, thực thi và xác minh. 17
35 Mục tiêu thực dụng là: tác tử có thể làm ra một sản phẩm, nhìn kết quả đã render, nhận ra điểm sai và tiếp tục cải thiện mà không buộc mọi quan sát hình ảnh phải đi qua một bản tóm tắt bằng văn bản.
Các mô hình thiên về văn bản vẫn rất hữu ích cho sinh mã, phân tích ngữ cảnh dài, gọi công cụ và những tác vụ mà đầu vào lẫn tiêu chí thành công vốn đã được diễn đạt bằng chữ. Trong một kiến trúc dùng công cụ, tác tử có thể gọi OCR để đọc chữ, kiểm tra DOM hoặc cây trợ năng, lấy tọa độ phần tử, hay gửi ảnh chụp màn hình cho một mô hình thị giác-ngôn ngữ riêng biệt. Cách làm này phù hợp với trích xuất tài liệu, kiểm tra giao diện có cấu trúc hoặc trả lời một câu hỏi trực quan đơn lẻ.
Đa phương thức gốc đặt cược vào hướng khác: huấn luyện để văn bản, ảnh, video, mã nguồn và trạng thái của tác tử có thể được xử lý cùng nhau. Nhờ đó, thông tin thị giác có thể tác động trực tiếp đến việc lập kế hoạch và sửa đổi. Một bài viết về thị trường mô hình Trung Quốc từng mô tả Moonshot, Alibaba và ByteDance theo đuổi hướng này, trong khi các bản phát hành đa dụng của DeepSeek, Zhipu và Hunyuan tại thời điểm đó tương đối thiên về văn bản. 15
Tuy nhiên, đây không nên được hiểu là ranh giới cố định giữa các công ty. DeepSeek V4 Flash và V4 Pro ban đầu chỉ hỗ trợ văn bản, nhưng sau đó DeepSeek đã giới thiệu bản thử nghiệm DeepSeek-V4-Flash-Vision-Exp. 13
4 Danh mục mô hình thay đổi rất nhanh, và các nguồn hiện có không đủ để kết luận về lý do nội bộ đằng sau lựa chọn của từng phòng thí nghiệm, đặc biệt với ByteDance, Zhipu và Tencent.
Một trang web không chỉ gồm chữ và cấu trúc DOM. Nó còn có phân cấp thị giác, khoảng trắng, căn chỉnh, độ tương phản, kiểu chữ, nội dung bị cắt, hình ảnh và quan hệ giữa các thành phần. Khi tác tử được giao tái tạo một thiết kế tham chiếu, những yếu tố này thường mới là tiêu chí nghiệm thu thực sự.
Một quy trình có thị giác trong vòng lặp có thể diễn ra như sau:
Qwen3.8-Max mô tả rõ mô hình vòng kín này: hiểu thị giác gốc được sử dụng trong lập kế hoạch, thực thi và xác minh cho các tác vụ dài hạn. Mô hình lưu trữ của hãng nhận đầu vào ảnh, văn bản và video, còn đầu ra là văn bản. 35 Kimi K3 cũng hiểu văn bản, hình ảnh và video trong cùng một mô hình, với cửa sổ ngữ cảnh 1 triệu token.
25
Lợi thế không chỉ là “mô hình có thể nhìn”. Đó là việc cùng một tác tử có thể giữ yêu cầu, mã nguồn, đầu ra trực quan và kế hoạch đang tiến triển trong một ngữ cảnh khi lặp lại công việc.
Các công cụ nhận thức bên ngoài vẫn hiệu quả trong nhiều trường hợp, nhưng chúng tạo thêm một lớp giao tiếp giữa việc nhìn và hành động.
Mô hình đa phương thức gốc không loại bỏ sai sót, nhưng có thể suy luận đồng thời trên ảnh chụp màn hình và bối cảnh triển khai, thay vì chỉ dựa vào bản tóm tắt bằng chữ về nội dung của ảnh. Đây là sức hút cốt lõi với phát triển front-end, tự động hóa GUI, gỡ lỗi hồi quy trực quan, chỉnh sửa ảnh và các quy trình làm việc với video.
Các kết quả công khai của Kimi K3 minh họa vì sao giới phát triển chú ý đến hướng tiếp cận này. Arena cho biết Kimi K3 đứng đầu Frontend Code Arena với 1.679 điểm, tăng 17 bậc so với Kimi K2.6, và xếp số 1 ở 6 trong 7 nhóm bài toán front-end được liệt kê. 32 Một báo cáo khác về thử nghiệm của nền tảng phát triển trình duyệt Puter cho biết Kimi K3 phát hiện cả 5 sai khác trực quan được cài chủ đích giữa trang mục tiêu và phiên bản đã render, không có kết quả dương tính giả.
28
Đây là những minh họa đáng chú ý về kiểm tra bằng thị giác. Dù vậy, chúng không chứng minh rằng chỉ riêng thị giác gốc đã tạo ra kết quả đó. Quy mô mô hình, dữ liệu huấn luyện, hậu huấn luyện, cách viết prompt, công cụ trình duyệt, lớp điều phối tác tử và chính thiết kế benchmark đều có thể ảnh hưởng hiệu năng. Kết luận thận trọng hơn là: phản hồi trực quan giải quyết một nhóm lỗi thực tế mà kiểm thử chỉ dựa trên văn bản có thể không phát hiện được.
Nên ưu tiên khi tác vụ cần quan sát và sửa đổi nhiều vòng, đồng thời độ trung thực trực quan là một phần của định nghĩa “hoàn thành”:
Ngược lại, chuỗi xử lý mô-đun gồm OCR hoặc mô hình thị giác bên ngoài vẫn có thể phù hợp hơn cho trích xuất chi phí thấp, xử lý theo lô, hoặc quy trình chỉ cần văn bản có cấu trúc và trạng thái giao diện. Câu hỏi then chốt không phải là thị giác có đang là xu hướng hay không, mà là tác tử có phải liên tục trả lời câu hỏi trực quan này không: “Kết quả này thực sự trông đã đúng chưa?”
Với nhóm công việc đó, đa phương thức gốc biến nhận thức từ một lần gọi công cụ không thường xuyên thành một phần của vòng vận hành của tác tử — hướng đi mà Kimi K3 và Qwen3.8-Max đang công khai theo đuổi. 17
35
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Đa phương thức gốc là lựa chọn xây dựng tác tử có phản hồi thị giác: Kimi K3 và Qwen3.8 Max kết hợp khả năng nhìn với suy luận dài hạn để tạo vòng lặp lập trình, hiển thị, kiểm tra và chỉnh sửa.
Đa phương thức gốc là lựa chọn xây dựng tác tử có phản hồi thị giác: Kimi K3 và Qwen3.8 Max kết hợp khả năng nhìn với suy luận dài hạn để tạo vòng lặp lập trình, hiển thị, kiểm tra và chỉnh sửa. Kimi K3 đạt 1.679 điểm, đứng đầu Frontend Code Arena; Qwen3.8 Max cho biết năng lực thị giác được dùng xuyên suốt các bước lập kế hoạch, thực thi và xác minh.