Ra mắt ngày 21/8/2026, DeepSeek V4 Flash Vision Exp bổ sung khả năng hiểu ảnh cho V4 Flash; mỗi ảnh được giới hạn ở 384 token đầu vào và tính phí theo mức của Flash. Nhà phát triển có thể gửi ảnh bằng Base64, URL công khai hoặc Files API; dịch vụ Files API miễn phí cho phép tải ảnh một lần rồi tái sử dụng qua file id.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What did DeepSeek’s August 21, 2026 launch of the V4-Flash-Vision-Exp multimodal vision API introduce, including its image-input methods, pr. Article summary: DeepSeek’s August 21 launch added experimental image understanding to its low-cost V4-Flash API, aiming to make DeepSeek agents able to perceive and act on screenshots and other visual state—not merely process text. It p. Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
Ngày 21/8/2026, DeepSeek đưa mô hình thử nghiệm deepseek-v4-flash-vision-exp lên nền tảng API, bổ sung khả năng hiểu hình ảnh cho dòng V4-Flash. Mô hình nhận đầu vào kết hợp văn bản và ảnh, giúp các nhà phát triển xây dựng agent có thể đọc ảnh chụp màn hình, giao diện, biểu đồ hoặc trạng thái trực quan của một ứng dụng với chi phí thấp hơn. 114
Điểm đáng chú ý nhất nằm ở cách tính phí: mỗi ảnh được chuyển đổi thành không quá 384 token đầu vào và tính theo mức giá của V4-Flash, thay vì chịu thêm một khoản phụ phí riêng cho khả năng nhìn ảnh. DeepSeek cũng tuyên bố hiệu năng agent đa phương thức của mô hình đang tiến gần Claude Opus 4.8. Dù vậy, đây vẫn là kết quả do công ty công bố và chưa được xác nhận độc lập. 319
Nhà phát triển gọi mô hình bằng mã API deepseek-v4-flash-vision-exp. Đây là biến thể đa phương thức của V4-Flash, kết hợp đầu vào hình ảnh với nền tảng xử lý văn bản, suy luận và sử dụng công cụ của dòng Flash. API hỗ trợ đầu vào ảnh-văn bản kết hợp qua các giao diện Chat Completions, Messages và Responses. 412
Vì vậy, đây không chỉ là một công cụ mô tả ảnh độc lập. Một agent có thể vận hành theo chu trình: quan sát ảnh chụp màn hình hiện tại, quyết định hành động, gọi công cụ rồi kiểm tra lại màn hình sau khi thao tác. Các bản trình diễn được đưa tin cho thấy mô hình có thể tạo mã thực thi từ ảnh chụp màn hình và sử dụng đầu vào trực quan trong quy trình xây dựng trò chơi. 510
Nhà phát triển có ba lựa chọn:
file_id được trả về để tham chiếu trong những yêu cầu tiếp theo. 6714Files API được cung cấp miễn phí và phù hợp nhất với các ứng dụng thường xuyên sử dụng cùng một ảnh. Thay vì tải lại dữ liệu ảnh trong mỗi lần gọi, ứng dụng có thể tái sử dụng tham chiếu tệp, qua đó giảm lượng dữ liệu phải truyền trong các quy trình agent lặp đi lặp lại. 112
DeepSeek cho biết mỗi ảnh được mã hóa để tính phí ở mức tối đa 384 token đầu vào. Các token này chịu mức giá thông thường của V4-Flash, nên việc phân tích ảnh không tạo ra một tầng giá cao hơn riêng cho tính năng thị giác. 3614
Một bảng giá công bố mức cao điểm là 0,44 USD cho mỗi triệu token đầu vào chưa được lưu trong bộ nhớ đệm và 1,32 USD cho mỗi triệu token đầu ra đối với mô hình thị giác. Bảng này cũng liệt kê cửa sổ ngữ cảnh 1 triệu token và giới hạn đầu ra tối đa 384.000 token. 1
Một số báo cáo mô tả giới hạn 384 token là chưa bằng một nửa lượng token hình ảnh được dùng trong một số so sánh với GPT và Claude. Tuy nhiên, đây chỉ nên được xem là nhận định định hướng: các dữ liệu hiện có chưa chứng minh những phép so sánh sử dụng cùng phiên bản mô hình, độ phân giải ảnh và giả định tính phí. 327
Điểm thực tế hơn nằm ở khả năng dự đoán chi phí. Với một agent phải liên tục kiểm tra ảnh chụp màn hình, khung hình trò chơi, bảng điều khiển hoặc trạng thái ứng dụng, mức trần token thấp có thể giúp mỗi vòng quan sát dễ kiểm soát hơn, thay vì phải dùng một mô hình đa phương thức cao cấp cho mọi lần kiểm tra.
DeepSeek cho biết mô hình mới duy trì các năng lực văn bản của V4-Flash, bao gồm suy luận, kiến thức thế giới và chức năng agent, đồng thời bổ sung đầu vào hình ảnh. 626
Công ty cũng công bố mức cải thiện đáng kể trên các bộ đánh giá agent đa phương thức, với kết quả được mô tả là tiến gần Claude Opus 4.8. Một số bảng so sánh cho thấy mô hình nằm gần Opus 4.8 ở các nhiệm vụ được chọn, nhưng kết quả có thể thay đổi tùy benchmark. 4192123
Vì thế, cụm từ “gần Opus 4.8” hiện nên được hiểu là tuyên bố dựa trên kết quả đánh giá của DeepSeek, chưa phải bằng chứng cho thấy hai mô hình tương đương trong mọi tác vụ agent thị giác. Các thử nghiệm độc lập sẽ cần đánh giá thêm độ tin cậy, độ chính xác khi đọc ảnh và khả năng sử dụng công cụ trong điều kiện thực tế.
Nhà phát triển nên kiểm tra kỹ các thiết lập suy luận trước khi đưa mô hình vào vòng lặp agent xử lý ảnh. Một thử nghiệm thực tế được báo cáo cho thấy token suy nghĩ có thể chiếm toàn bộ ngân sách hoàn thành, khiến câu trả lời hiển thị không còn nội dung. Báo cáo này khuyến nghị tắt thinking trong những tác vụ thị giác phù hợp hoặc tăng max_tokens để mô hình có đủ chỗ trả về kết quả. 27
Đây là cảnh báo khi tích hợp, không phải kết luận chung về năng lực của mô hình. Nếu bật suy luận, ứng dụng cần dành đủ ngân sách đầu ra cho cả quá trình suy nghĩ lẫn câu trả lời gửi tới người dùng. Các nhóm phát triển cũng nên đối chiếu hành vi và tên tham số mới nhất trong tài liệu API của DeepSeek trước khi phụ thuộc vào một thiết lập cụ thể.
Các nguồn được cung cấp không nêu một lý do chiến lược chính thức từ DeepSeek. Tuy nhiên, thiết kế sản phẩm cho thấy một hướng sử dụng rõ ràng: làm cho khả năng quan sát trực quan đủ rẻ để agent có thể thực hiện nhiều lần liên tiếp.
Ảnh chụp màn hình, khung hình trò chơi, bảng điều khiển và trạng thái ứng dụng chỉ thực sự hữu ích cho agent nếu mô hình có thể kiểm tra chúng thường xuyên mà không khiến chi phí của từng vòng lặp tăng quá cao. Đưa tính năng thị giác vào một biến thể Flash thử nghiệm cũng cho phép nhà phát triển bổ sung đầu vào hình ảnh vào quy trình agent và gọi công cụ hiện có, thay vì chuyển toàn bộ ứng dụng sang một tầng đa phương thức cao cấp hơn.
Với nhà phát triển các agent điều khiển bằng màn hình, công cụ chuyển ảnh chụp thành mã hoặc ứng dụng cần phản hồi trực quan liên tục, đây là điểm đáng quan tâm nhất của bản phát hành. DeepSeek V4-Flash-Vision-Exp đưa ra mức trần token hình ảnh thấp, nhiều phương thức tiếp nhận ảnh và Files API miễn phí; đổi lại, các tuyên bố về vị trí trên bảng xếp hạng cũng như hành vi trong môi trường sản xuất vẫn cần được kiểm chứng. Cách tiếp cận thận trọng là thử nghiệm với ảnh chụp thực tế, đặt ngân sách đầu ra rõ ràng và dùng các bước đánh giá chất lượng độc lập.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
Ra mắt ngày 21/8/2026, DeepSeek V4 Flash Vision Exp bổ sung khả năng hiểu ảnh cho V4 Flash; mỗi ảnh được giới hạn ở 384 token đầu vào và tính phí theo mức của Flash.
Ra mắt ngày 21/8/2026, DeepSeek V4 Flash Vision Exp bổ sung khả năng hiểu ảnh cho V4 Flash; mỗi ảnh được giới hạn ở 384 token đầu vào và tính phí theo mức của Flash. Nhà phát triển có thể gửi ảnh bằng Base64, URL công khai hoặc Files API; dịch vụ Files API miễn phí cho phép tải ảnh một lần rồi tái sử dụng qua file id.
DeepSeek cho biết mô hình giữ nguyên năng lực văn bản, suy luận và tác vụ agent của V4 Flash, nhưng khi tích hợp cần kiểm soát ngân sách đầu ra vì chế độ thinking có thể chiếm toàn bộ phần trả lời trong một số thử ngh...