Tuy nhiên, kết quả này cần được đọc một cách thận trọng. Cụm từ “tiệm cận Opus 4.8” chỉ mô tả hiệu suất trong tập đánh giá do DeepSeek lựa chọn; nó chưa chứng minh hai model có chất lượng ngang nhau ở mọi tác vụ thị giác, bài toán lập trình hay các phiên agent kéo dài.
Nhật ký chính thức của DeepSeek công bố một số điểm Vision-Exp như 36,5 trên ApexBench, 27,3 trên Agents’ Last Exam, 64,3 trên Chartography và 35,0 trên ZeroBench Pass@5.
Các con số này cũng chưa trả lời nhiều câu hỏi quan trọng khi triển khai thực tế: model có ổn định không, phản hồi nhanh đến đâu, xử lý lỗi thế nào và hoạt động ra sao trong môi trường công cụ cụ thể. Kết quả benchmark có thể thay đổi đáng kể tùy prompt, công cụ, cách chọn nhiệm vụ, yêu cầu độ trễ và phương pháp đánh giá. Dữ liệu hiện có chưa đủ để xem đây là một bảng xếp hạng model mang tính kết luận.
Tuyên bố mạnh nhất của DeepSeek về phần văn bản là khả năng duy trì hiệu suất, thay vì rõ ràng vượt trội. Hãng định vị Vision-Exp như một phần mở rộng của V4-Flash: nhà phát triển có thể bổ sung đầu vào hình ảnh mà không phải từ bỏ năng lực suy luận và vận hành agent vốn có.
Điều này dẫn đến một số cách cân nhắc thực tế:
DeepSeek cung cấp Vision-Exp trên nền tảng API của mình. Model hỗ trợ Chat Completions, Messages và Responses, trong đó có đầu vào kết hợp văn bản và hình ảnh.
Có ba cách đưa hình ảnh vào yêu cầu:
file_id trong các yêu cầu sau.Các định dạng được tài liệu hóa gồm JPEG, PNG, GIF và WebP. Responses API cũng chấp nhận một phần nội dung
input_image với URL ảnh, data URL dạng base64 hoặc tham chiếu tới tệp đã tải lên.
Hình ảnh được chuyển đổi thành token đầu vào để tính phí. DeepSeek cho biết mỗi ảnh đóng góp không quá 384 token, theo cơ chế giá của V4-Flash.
Mức giá V4-Flash được công bố cùng thời điểm ra mắt gồm:
Giới hạn 384 token giúp chi phí phần hình ảnh trong mỗi yêu cầu tương đối dễ dự đoán. Tuy vậy, mức trần này không bao gồm văn bản đi kèm, các lượt gọi công cụ hoặc nội dung model sinh ra. Một phiên agent hoàn chỉnh vì thế vẫn có thể tiêu thụ nhiều token hơn đáng kể so với riêng phần ảnh.
DeepSeek phát hành Harness 0.1.1 với hỗ trợ sẵn cho Vision-Exp. Đây là chi tiết đáng chú ý với những người xây dựng agent, thay vì chỉ gửi các câu hỏi đơn lẻ về hình ảnh, bởi model được định hướng cho các quy trình có sử dụng công cụ.
Cùng đợt ra mắt, DeepSeek cũng mở Files API miễn phí. Nhà phát triển có thể tải một hình ảnh lên một lần rồi sử dụng lại trong các yêu cầu tiếp theo bằng cách truyền file_id, thay vì liên tục gửi lại cùng một dữ liệu ảnh. DeepSeek ghi nhận các tham chiếu tệp theo định dạng file-api-....
Cách làm này phù hợp khi agent cần xem lại cùng một ảnh chụp màn hình, trang tài liệu hoặc tài sản hình ảnh qua nhiều lượt hội thoại. Files API có thể miễn phí, nhưng phần suy luận của model và lượng token sử dụng vẫn được tính phí.
Vision-Exp cho thấy cạnh tranh AI đang mở rộng từ chất lượng model sang toàn bộ gói dành cho nhà phát triển: năng lực đa phương thức, khả năng tương thích API, giá, tệp có thể tái sử dụng và công cụ xây dựng agent. DeepSeek đưa khả năng thị giác vào dòng Flash với mức giá token được công bố giống V4-Flash, đồng thời lấy Opus 4.8 của Anthropic làm mốc so sánh cao cấp trong báo cáo của mình.
Dù vậy, đây vẫn là một bản phát hành “Flash” và “Exp” — tức thiên về thử nghiệm và mở rộng khả năng ứng dụng, không phải tuyên bố mới về model flagship. Tầm quan trọng thực tế của nó sẽ phụ thuộc vào việc các nhà phát triển có thấy model đủ đáng tin cậy cho những tác vụ như lập trình dựa trên ảnh chụp màn hình, phân tích tài liệu, agent giao diện và sử dụng công cụ trực quan hay không.
Kết luận hợp lý nhất lúc này là: DeepSeek đã giúp khả năng suy luận bằng hình ảnh trở nên dễ tiếp cận hơn qua hệ sinh thái API hiện có, còn các benchmark ban đầu cho thấy model có thể tạo sức ép đáng kể trong một số bài kiểm tra đa phương thức. Nhưng cần thêm đánh giá độc lập, dữ liệu về độ tin cậy ngoài thực tế và mức độ chấp nhận lâu dài của nhà phát triển để xác định Vision-Exp sẽ trở thành một lựa chọn bền vững hay chỉ là một bản thử nghiệm nhiều tiềm năng.