V4 Flash Vision Exp bổ sung khả năng hiểu hình ảnh ở cùng tầng giá với V4 Flash, mỗi ảnh được tính tối đa 384 token. Mô hình có thể giúp giảm chi phí cho các tác vụ xử lý ảnh chụp màn hình, tài liệu và giao diện trình duyệt, đặc biệt ở quy mô lớn.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How could DeepSeek’s August 22, 2026 release of the V4-Flash-Vision-Exp multimodal AI model—which it says matches its existing V4-Flash mode. Article summary: DeepSeek’s vision release is potentially more important as a pricing signal than as proof of a lasting capability lead: if independent tests confirm near-frontier multimodal-agent performance at Flash-level cost, it coul. Topic tags: general, news, general web. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fake numbers
DeepSeek V4-Flash-Vision-Exp có thể quan trọng hơn với tư cách một tín hiệu về giá, thay vì là bằng chứng cho thấy công ty đã tạo ra lợi thế năng lực bền vững. Mô hình thử nghiệm này bổ sung khả năng hiểu hình ảnh vào kiến trúc V4-Flash. DeepSeek cho biết mô hình vẫn giữ năng lực suy luận, tác vụ tác tử và kiến thức thế giới của phiên bản văn bản, đồng thời đưa hiệu năng tác tử đa phương thức đến gần Claude Opus 4.8 của Anthropic. Hình ảnh được tính phí theo mức giá của V4-Flash, với tối đa 384 token đầu vào cho mỗi ảnh. 64
Sự kết hợp này có thể khiến việc triển khai AI có khả năng nhìn — từ đọc ảnh chụp màn hình đến phân tích tài liệu — rẻ hơn đáng kể. Tuy nhiên, kết quả thương mại vẫn chưa rõ ràng. Các so sánh nổi bật hiện chủ yếu dựa trên đánh giá do DeepSeek công bố hoặc những nguồn đưa tin có liên quan chặt chẽ; trong sản xuất thực tế, độ ổn định, khả năng cung cấp, độ trễ và mức độ chấp nhận của doanh nghiệp mới là những yếu tố quyết định.
Khả năng xử lý hình ảnh thường được xem là một tính năng cao cấp, bởi các ứng dụng dùng nhiều ảnh có thể cần thêm năng lực tính toán và xử lý. DeepSeek đi theo hướng khác: đưa đầu vào hình ảnh vào tầng Flash thay vì tạo một mức giá vision cao cấp riêng.
Theo các mức giá được công bố, V4-Flash-Vision-Exp có giá 0,22 USD cho mỗi 1 triệu token đầu vào không được lưu trong bộ nhớ đệm và 0,66 USD cho mỗi 1 triệu token đầu ra vào giờ thấp điểm. Hai mức này tăng lên lần lượt 0,44 USD và 1,32 USD vào giờ cao điểm. Token đầu vào được lưu trong bộ nhớ đệm có giá thấp hơn. 51
Mô hình giá này đặc biệt có ý nghĩa với các ứng dụng thường xuyên xử lý ảnh chụp màn hình, biểu mẫu, bảng điều khiển, hóa đơn, sơ đồ kỹ thuật hoặc giao diện trình duyệt. Nếu mô hình đủ tốt cho những tác vụ thường nhật với chi phí đầu vào thấp, nhà phát triển có thể chạy nhiều vòng kiểm tra hình ảnh, thử lại và bước tác tử hơn trong cùng một ngân sách.
Giới hạn 384 token cũng là một điểm cần lưu ý. Nó giúp chi phí xử lý ảnh ở mức thấp, nhưng giới hạn cố định này có thể làm giảm hiệu quả trong các tác vụ cần nhìn rõ chi tiết nhỏ, văn bản dày đặc hoặc mối quan hệ không gian chính xác. Chi phí hình ảnh thấp vì thế không đồng nghĩa với chất lượng thị giác cao trong mọi loại công việc. 53
DeepSeek cho biết mô hình mới đã cải thiện lớn so với V4-Flash chỉ có văn bản trong các bài đánh giá tác tử đa phương thức và tiến gần Opus 4.8. Các kết quả được công bố cho thấy bức tranh không hoàn toàn nghiêng về một bên: V4-Flash-Vision-Exp đạt 36,5 điểm so với 39,4 của Opus 4.8 ở ApexBench Pass@1, nhưng cao hơn ở Agents’ Last Exam với 27,3 so với 25,7, và ở ZeroBench với 35,0 so với 34,0. 58
Đây là những kết quả đáng chú ý, nhưng khoảng cách nhỏ trên benchmark không đồng nghĩa với sự tương đương trong môi trường sản xuất. Doanh nghiệp và nhà phát triển cũng cần kiểm tra:
Bước tiếp theo có ý nghĩa nhất là các bài kiểm tra độc lập, có thể tái lập. Cho đến khi có dữ liệu như vậy, kết luận thận trọng nhất là DeepSeek đã đưa ra một thách thức giá rẻ nhưng đáng tin cậy — chứ chưa thể khẳng định công ty đã vượt qua các mô hình tiên phong hàng đầu.
Nếu chứng minh được độ tin cậy bên ngoài các bài đánh giá của chính DeepSeek, mô hình này có thể làm suy yếu khả năng thu phí cao của Anthropic, OpenAI và Google chỉ dựa trên năng lực suy luận chung hoặc hiểu hình ảnh. Sức ép sẽ lớn nhất ở những lĩnh vực khối lượng cao, nhạy cảm với chi phí, nơi mô hình chỉ cần đủ tốt cho các tác vụ thường nhật.
Các nhà cung cấp cao cấp vẫn có nhiều cách bảo vệ mô hình kinh doanh. Họ có thể cạnh tranh bằng độ tin cậy trong các quy trình kéo dài, hệ sinh thái công cụ, an ninh, quản trị, hỗ trợ khách hàng, tích hợp đám mây và khả năng phân phối. Một mô hình rẻ hơn hoặc mạnh hơn trong một benchmark hẹp vẫn có thể thất thế khi triển khai cho doanh nghiệp nếu gây ra nhiều lỗi hơn, đòi hỏi giám sát bổ sung hoặc thiếu các cơ chế kiểm soát cần thiết.
Điều này có thể dẫn đến một thị trường phân tầng rõ hơn:
Rủi ro với các nhà cung cấp cao cấp không nhất thiết là nhu cầu sụt giảm, mà là khách hàng giảm mức sẵn sàng trả tiền cho năng lực không khác biệt rõ ràng. Doanh nghiệp có thể dùng nhiều mô hình cùng lúc, chuyển các tác vụ hình ảnh đơn giản sang hệ thống rẻ hơn và chỉ dành mô hình cao cấp cho những trường hợp chất lượng thực sự quan trọng.
DeepSeek không đơn giản là giảm giá trên toàn bộ danh mục sản phẩm. Vào tháng 8, công ty đưa ra cơ chế giá cao điểm và thấp điểm cho V4-Pro và V4-Flash, với mức tăng được đưa tin dao động từ 50% đến 1.100%, tùy model, loại token và thời điểm sử dụng. 17
Động thái này cho thấy DeepSeek cũng đang quản lý công suất và nhu cầu, chứ không chỉ tìm cách liên tục bán rẻ hơn đối thủ. Công ty có thể dùng Flash Vision như một cửa ngõ giá thấp để thu hút người dùng, sau đó kiếm tiền từ năng lực suy luận cao cấp, thông lượng lớn hơn hoặc nhu cầu sử dụng vào giờ cao điểm.
Với nhà phát triển, thước đo phù hợp là tổng chi phí thực tế, không phải mức giá quảng cáo thấp nhất. Ngân sách cần tính đến thời điểm sử dụng, token đầu ra, tỷ lệ truy cập bộ nhớ đệm, số lần thử lại, độ trễ và lỗi vận hành. Một mô hình rẻ nhưng phải chạy lại nhiều lần chưa chắc có chi phí thấp hơn trong thực tế.
Sự xuất hiện của DeepSeek diễn ra trong lúc Anthropic đang ghi nhận nhu cầu tăng mạnh. Reuters đưa tin doanh thu thường niên hóa của Anthropic đã vượt 65 tỷ USD vào cuối tháng 7, tăng từ 47 tỷ USD vào tháng 5. “Doanh thu thường niên hóa” là phép ngoại suy kết quả gần đây thành quy mô một năm; đây không phải doanh thu đã ghi nhận trong cả năm và cũng không bảo đảm cho biên lợi nhuận tương lai. 33
Phân biệt này rất quan trọng. Mô hình của DeepSeek không xóa bỏ tín hiệu tăng trưởng hiện tại của Anthropic, nhưng có thể thách thức những giả định về quyền định giá và hiệu quả đầu tư hạ tầng trong tương lai. Nếu khách hàng chuyển các tác vụ thường nhật sang các mô hình đa phương thức rẻ hơn, Anthropic có thể phải tăng chiết khấu hoặc chi thêm tiền để giữ thị phần.
Amazon là doanh nghiệp có mức độ liên quan trực tiếp đặc biệt lớn. Amazon đã đồng ý đầu tư ngay 5 tỷ USD vào Anthropic, cùng khả năng đầu tư thêm tối đa 20 tỷ USD gắn với các mốc thương mại. Anthropic cũng cam kết chi hơn 100 tỷ USD cho công nghệ đám mây của Amazon trong 10 năm. 1
Nhu cầu mạnh đối với Claude có thể mang lại lợi ích cho Amazon thông qua cả mức tiêu thụ dịch vụ đám mây lẫn giá trị khoản đầu tư vào Anthropic. Ngược lại, nếu người dùng chuyển bền vững sang các đối thủ rẻ hơn, tốc độ tăng trưởng sử dụng hoặc quyền định giá của Anthropic có thể suy yếu, khiến cam kết hạ tầng lớn trở nên khó biện minh hơn. Thỏa thuận này vì vậy vừa tạo ra cơ hội tăng trưởng đáng kể, vừa tập trung một phần luận điểm đầu tư AI của Amazon vào khả năng Anthropic tiếp tục mở rộng.
Alphabet có mức độ tiếp xúc khác. Công ty vừa là nhà đầu tư vào Anthropic, vừa cạnh tranh trực tiếp thông qua Gemini và Google Cloud. 6 Các mô hình đa phương thức rẻ nhưng đủ đáng tin cậy có thể gây sức ép lên mặt bằng giá toàn thị trường, bao gồm API và các dịch vụ AI đám mây của Google. Bất kỳ lợi ích gián tiếp nào từ mức định giá Anthropic cũng cần được cân nhắc cùng áp lực cạnh tranh lên sản phẩm của chính Alphabet.
Dữ liệu sắp tới quan trọng hơn thông báo ra mắt. Nhà đầu tư và nhà phát triển nên theo dõi:
V4-Flash-Vision-Exp có thể đẩy nhanh quá trình chuyển từ cuộc đua năng lực sang cuộc đua giữa giá và hiệu năng. Điểm quan trọng nhất của mô hình có lẽ không nằm ở việc đôi lúc ngang bằng hoặc vượt Opus 4.8 trong một số bài đánh giá, mà ở tuyên bố đưa hiệu năng tác tử đa phương thức hữu ích xuống tầng Flash giá rẻ.
Tác động tài chính chỉ thực sự mang tính đột phá nếu mô hình đủ đáng tin cậy để vận hành lâu dài trong sản xuất. Ở thời điểm hiện tại, đây nên được xem là lời cảnh báo đáng chú ý dành cho các nhà cung cấp AI cao cấp và nhà đầu tư của họ: giả định về giá mô hình tiên phong, mức độ gắn bó của khách hàng và lợi nhuận từ hạ tầng sẽ phải được bảo vệ bằng những lợi thế sản phẩm có thể đo lường, không chỉ bằng danh tiếng trên benchmark.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
V4 Flash Vision Exp bổ sung khả năng hiểu hình ảnh ở cùng tầng giá với V4 Flash, mỗi ảnh được tính tối đa 384 token.
V4 Flash Vision Exp bổ sung khả năng hiểu hình ảnh ở cùng tầng giá với V4 Flash, mỗi ảnh được tính tối đa 384 token. Mô hình có thể giúp giảm chi phí cho các tác vụ xử lý ảnh chụp màn hình, tài liệu và giao diện trình duyệt, đặc biệt ở quy mô lớn.
Doanh thu thường niên hóa được báo cáo của Anthropic vẫn vượt 65 tỷ USD vào cuối tháng 7, vì vậy DeepSeek hiện là rủi ro về giá và biên lợi nhuận — chưa phải bằng chứng cho thấy nhu cầu đối với mô hình cao cấp đã biến...