Ra mắt ngày 21/8/2026, DeepSeek V4 Flash Vision Exp là mô hình API đa phương thức thử nghiệm, giữ các năng lực văn bản, suy luận và tác vụ agent của V4 Flash nhưng bổ sung khả năng hiểu hình ảnh. Mô hình nhận ảnh JPEG, PNG, GIF và WebP qua các API Chat Completions và Responses, phù hợp để đọc ảnh chụp màn hình, tài...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What is DeepSeek-V4-Flash-Vision-Exp, the experimental multimodal variant of DeepSeek’s V4-Flash text model, and how does its claimed perfor. Article summary: DeepSeek-V4-Flash-Vision-Exp is a newly released, API-only experimental multimodal version of DeepSeek V4-Flash: it retains the base model’s text/agent, reasoning, and world-knowledge functions while adding image underst. Topic tags: general, general web, user generated, documentation. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks,
DeepSeek-V4-Flash-Vision-Exp là thành viên đầu tiên có khả năng nhìn trong dòng API V4-Flash của DeepSeek. Mô hình được quảng bá là giữ nguyên năng lực văn bản, suy luận, agent và kiến thức thế giới của V4-Flash, đồng thời bổ sung khả năng hiểu hình ảnh cho các quy trình đa phương thức. DeepSeek mô tả đây là một mô hình thử nghiệm và cho biết năng lực agent đa phương thức của nó đã tiến gần Claude Opus 4.8. Tuy vậy, chưa có đủ bằng chứng độc lập để xem tuyên bố này như một kết quả xếp hạng đã được xác lập.
Mô hình được cung cấp qua API với mã định danh deepseek-v4-flash-vision-exp. Theo ghi chú phát hành của DeepSeek, Vision Exp tương đương V4-Flash ở các năng lực văn bản như agent, suy luận và kiến thức thế giới, trong khi cải thiện đáng kể ở những bài đánh giá đòi hỏi hiểu hình ảnh.
Điểm thay đổi quan trọng nhất nằm ở đầu vào. Mô hình có thể xử lý văn bản cùng ảnh JPEG, PNG, GIF hoặc WebP. Nhờ đó, nhà phát triển có thể dùng nó để mô tả ảnh, đọc chữ trong ảnh chụp màn hình, trả lời câu hỏi trực quan hoặc phân tích biểu đồ.
Tuy nhiên, hậu tố Exp không phải chi tiết mang tính hình thức. Đây là một bản phát hành API thử nghiệm, phù hợp để kiểm tra và triển khai có kiểm soát hơn là mặc định thay thế một mô hình đã ổn định trong môi trường sản xuất.
DeepSeek tài liệu hóa việc gửi yêu cầu kết hợp văn bản và hình ảnh, đồng thời hỗ trợ mô hình qua cả giao diện Chat Completions lẫn Responses. Tài liệu API liệt kê deepseek-v4-flash-vision-exp là một mã mô hình hợp lệ cho các endpoint này.
Ảnh có thể được cung cấp theo nhiều cách, gồm dữ liệu ảnh nhúng trực tiếp, URL bên ngoài và Files API. Tài liệu Responses API cũng mô tả cụ thể cách truyền ảnh với Vision Exp.
Điều này đặc biệt đáng chú ý với các hệ thống agent. Một agent có thể đọc ảnh chụp màn hình, biểu đồ, tài liệu scan hoặc giao diện ứng dụng trước khi quyết định gọi công cụ nào tiếp theo. DeepSeek cũng tài liệu hóa tích hợp Codex, trong đó Vision Exp là một lựa chọn bổ sung khả năng nhận ảnh.
Theo ghi chú phát hành, DeepSeek Harness 0.1.1 đã thêm hỗ trợ cho mô hình, mở thêm một hướng kết nối với các quy trình agent. Trong khi đó, tài liệu GitHub Copilot của DeepSeek chỉ nêu V4 Pro và V4 Flash trong bộ chọn mô hình, đồng thời mô tả việc xử lý ảnh thông qua một mô hình Copilot khác. Vì vậy, các tài liệu hiện có chưa xác nhận Vision Exp đã được cung cấp trực tiếp trong bộ chọn đó.
Tuyên bố cốt lõi của DeepSeek là Vision Exp duy trì hiệu năng văn bản của V4-Flash, đồng thời tạo bước tiến lớn trên các bài đánh giá agent đa phương thức, đưa năng lực này đến gần Claude Opus 4.8.
Một số bài viết dẫn lại các điểm số riêng lẻ như Chartography 64,3, ApexBench Pass@1 36,5, Agents’ Last Exam 27,3 và ZeroBench Pass@5 35,0. Tuy nhiên, các con số này xuất hiện qua thông tin thứ cấp về thông báo của DeepSeek, chứ chưa phải một cuộc đánh giá liên nhà cung cấp có phương pháp chi tiết và khả năng tái lập độc lập.
Sự khác biệt này rất quan trọng. Cụm từ “gần ngang Opus 4.8” không có nghĩa Vision Exp vượt Claude trên tổng thể, đạt kết quả tương đương ở mọi tác vụ hay có độ tin cậy sản xuất tương đương. Các nguồn hiện có cũng chưa cung cấp một phép so sánh trung lập với cùng prompt, môi trường công cụ, độ trễ, tỷ lệ lỗi và chi phí giữa DeepSeek và Anthropic.
Kết luận thận trọng nhất là: DeepSeek đã phát hành một mô hình API có khả năng xử lý hình ảnh, được tài liệu hóa rõ ràng; các kết quả do công ty công bố cho thấy một bước cải thiện đáng kể so với V4-Flash chỉ dùng văn bản ở những tác vụ phụ thuộc vào thị giác. Vị trí của mô hình so với Claude, OpenAI, Google hay các phòng thí nghiệm AI khác tại Trung Quốc vẫn chưa được xác nhận.
Các bảng thông tin mô hình hiện có niêm yết Vision Exp ở mức 0,22 USD cho mỗi triệu token đầu vào và 0,66 USD cho mỗi triệu token đầu ra, với cửa sổ ngữ cảnh 1 triệu token. Tài liệu giá chính thức của DeepSeek xác nhận API được tính theo mỗi triệu token và liệt kê
deepseek-v4-flash-vision-exp trong bảng mô hình.
Ảnh được chuyển thành token để tính phí API. Một báo cáo dẫn hướng dẫn do DeepSeek công bố cho biết một ảnh có thể chiếm tối đa 384 token và mô hình áp dụng cấu trúc giá của V4-Flash. Vì thế, chi phí thực tế của một quy trình xử lý hình ảnh còn phụ thuộc vào số lượng và kích thước ảnh, phần văn bản đi kèm, độ dài câu trả lời và lượng ngữ cảnh được lặp lại.
Anthropic niêm yết Claude Opus 4.8 ở mức 5 USD cho mỗi triệu token đầu vào cơ bản và 25 USD cho mỗi triệu token đầu ra. Công ty cũng có các mức giá riêng cho bộ nhớ đệm và chế độ nhanh.
Xét riêng giá token niêm yết, DeepSeek rẻ hơn đáng kể. Đây là lý do hợp lý để nhà phát triển thử nghiệm mô hình, nhưng chưa đủ để kết luận về tổng chi phí sở hữu. Một mô hình rẻ hơn nhưng thường xuyên cần chạy lại, gọi sai công cụ hoặc yêu cầu tiền xử lý ảnh bổ sung có thể không rẻ hơn nếu tính toàn bộ quy trình.
Hai mô hình có những trường hợp sử dụng giao nhau, nhưng giữ vị trí khác nhau trên thị trường:
Thông điệp chiến lược của DeepSeek khá rõ: đưa khả năng nhìn vào nhóm mô hình Flash có chi phí thấp, đồng thời tuyên bố đạt hiệu năng gần một mô hình cao cấp trên các tác vụ agent đa phương thức. Lợi thế của Claude trong phép so sánh này không được chứng minh là vượt DeepSeek ở mọi benchmark bằng các nguồn hiện có; đó là mức độ trưởng thành, bề rộng sản phẩm và vị thế đã được xác lập của mô hình cùng hệ thống công cụ xung quanh.
Do đó, nên so sánh theo từng tác vụ cụ thể. Với một pipeline đọc ảnh chụp màn hình hoặc trích xuất dữ liệu từ biểu đồ, Vision Exp có thể đạt chất lượng đủ dùng với chi phí token thấp hơn nhiều. Nhưng trong quy trình tự động hóa có rủi ro cao, các yếu tố quan trọng hơn gồm tính nhất quán, độ chính xác khi dùng công cụ, cách xử lý yêu cầu bị từ chối, khả năng quan sát hệ thống, hỗ trợ kỹ thuật và phục hồi sau lỗi.
Điểm đáng chú ý của bản phát hành là khả năng nhìn ngày càng trở thành một phần của công việc agent, thay vì chỉ phục vụ hỏi đáp về hình ảnh. Agent lập trình có thể cần đọc ảnh chụp màn hình, agent trình duyệt cần hiểu nội dung trang web, còn hệ thống doanh nghiệp có thể phải kết hợp tài liệu, biểu đồ và các lệnh gọi công cụ có cấu trúc.
Gia đình DeepSeek V4 vốn nhấn mạnh ngữ cảnh dài và các tác vụ agent; tài liệu V4 của công ty định vị Flash là lựa chọn nhanh hơn, tiết kiệm hơn trong cùng dòng sản phẩm. Vision Exp tiếp tục hướng đi đó bằng cách đưa hình ảnh vào agent đa phương thức, thay vì tạo một mô hình chỉ chuyên hỏi đáp về ảnh.
Dẫu vậy, các dữ liệu hiện có chưa đủ để tuyên bố DeepSeek đang dẫn trước Anthropic, OpenAI, Google hay những phòng thí nghiệm AI hàng đầu tại Trung Quốc. Chưa có đánh giá độc lập theo phương pháp “cùng điều kiện” giữa các nhà cung cấp, và một API thử nghiệm không tương đương với một mô hình chủ lực đã được chứng minh trong môi trường sản xuất.
Có, nhưng nên thử trong phạm vi được kiểm soát.
Một bài đánh giá thực tế nên đặt Vision Exp cạnh Claude Opus 4.8 và mô hình đang dùng trong sản xuất, với cùng một nhóm tác vụ kết hợp hình ảnh và công cụ. Hãy theo dõi:
Cho đến khi có dữ liệu như vậy, đánh giá phù hợp nhất là tích cực nhưng thận trọng: DeepSeek V4 Flash Vision Exp là một thử nghiệm API đa phương thức đáng chú ý, có mức giá niêm yết hấp dẫn và giao diện phát triển hữu ích. Tuyên bố về năng lực agent đa phương thức gần Claude Opus 4.8 đáng để kiểm tra, nhưng chưa nên được xem là sự thật đã được độc lập xác lập.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt ngày 21/8/2026, DeepSeek V4 Flash Vision Exp là mô hình API đa phương thức thử nghiệm, giữ các năng lực văn bản, suy luận và tác vụ agent của V4 Flash nhưng bổ sung khả năng hiểu hình ảnh.
Ra mắt ngày 21/8/2026, DeepSeek V4 Flash Vision Exp là mô hình API đa phương thức thử nghiệm, giữ các năng lực văn bản, suy luận và tác vụ agent của V4 Flash nhưng bổ sung khả năng hiểu hình ảnh. Mô hình nhận ảnh JPEG, PNG, GIF và WebP qua các API Chat Completions và Responses, phù hợp để đọc ảnh chụp màn hình, tài liệu, biểu đồ và xây dựng quy trình agent kết hợp hình ảnh với công cụ.
Các bảng giá hiện có ghi nhận mức 0,22 USD cho mỗi triệu token đầu vào và 0,66 USD cho mỗi triệu token đầu ra, thấp hơn đáng kể so với mức 5 USD và 25 USD của Claude Opus 4.8; tuy nhiên, chi phí token hình ảnh và chất...