DeepSeek V4 Flash đứng đầu bảng xếp hạng sử dụng theo tuần của OpenRouter giai đoạn 27/7–2/8 với 7,22 nghìn tỷ token, nhưng tuần này bao gồm cả thời gian trước khi bản 0731 phát hành chính thức. Trên tuyến DeepSeek V4 Flash 0731, OpenRouter niêm yết giá 0,05 USD cho một triệu token đầu vào và 0,16 USD cho một triệu...
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: How did DeepSeek V4-Flash, launched in public API beta on July 31, 2026, become OpenRouter’s most-used model within four days—reaching 7.1 t. Article summary: The reported surge is best explained by an unusually strong cost–capability–context combination, amplified by OpenRouter’s low-friction routing and likely substantial trial traffic—not by architecture alone. But several . Topic tags: general, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
DeepSeek-V4-Flash-0731 trở thành một ví dụ đáng chú ý về tốc độ mà “model mặc định” của lập trình viên có thể thay đổi khi ba yếu tố cùng xuất hiện: giá token thấp, dung lượng ngữ cảnh lớn và khả năng truy cập dễ dàng qua một nền tảng tổng hợp model. Theo báo cáo, DeepSeek V4 Flash đứng đầu bảng xếp hạng sử dụng theo tuần của OpenRouter trong giai đoạn 27/7–2/8, với 7,22 nghìn tỷ token được xử lý. Tuy nhiên, con số nổi bật này cần được diễn giải thận trọng. 5
Bản phát hành ngày 31/7 là một model Mixture-of-Experts (MoE) thưa: tổng cộng 284 tỷ tham số, nhưng chỉ 13 tỷ tham số được kích hoạt cho mỗi token. OpenRouter mô tả model này phù hợp cho lập trình, suy luận và quy trình tác tử AI; trang model cũng liệt kê cửa sổ ngữ cảnh 1.310.720 token. 1
Tổ hợp này đặc biệt đáng chú ý với những khối lượng công việc tiêu tốn nhiều token:
Bản thân kiến trúc MoE không tự động chứng minh chi phí thực tế thấp hơn hoặc chất lượng tốt hơn. Ý nghĩa kinh tế của nó là model chỉ kích hoạt một phần tham số cho mỗi token, nhằm cung cấp năng lực lớn mà không mang mức tính toán trên mỗi token như một model dày đặc có quy mô tổng tương đương. Lợi ích đó có đến được ứng dụng hay không vẫn phụ thuộc vào độ trễ, năng lực hạ tầng của nhà cung cấp, cơ chế định tuyến, cách thiết kế prompt và độ dài đầu ra.
TechNode đưa tin DeepSeek V4 Flash đã xử lý 7,22 nghìn tỷ token trên OpenRouter trong tuần từ 27/7 đến 2/8. Báo cáo này cũng cho biết các model Trung Quốc chiếm bốn vị trí đầu, còn DeepSeek V4 Flash 0731 và V4 Pro đều nằm trong top 6. 5
Tuy vậy, tuần thống kê bắt đầu trước ngày 31/7 — thời điểm bản public beta được phát hành. V4 Flash trước đó đã tồn tại dưới dạng tuyến preview, còn bản 0731 thay thế preview này trên endpoint API deepseek-v4-flash. 3 Vì thế, không nên mô tả toàn bộ tổng lượng token trong tuần là do riêng phiên bản mới phát hành tạo ra.
Truy cập miễn phí cũng là một biến số lớn. Cùng báo cáo trên cho biết OpenCode xử lý 8 nghìn tỷ token cho model này trong ngày 1/8, trong đó 5 nghìn tỷ token đến từ các lượt dùng thử miễn phí và 3 nghìn tỷ token do lập trình viên trả tiền. 5 Lưu lượng dùng thử có giá trị chiến lược vì giúp nhiều nhà phát triển trải nghiệm model với ít rào cản hơn, nhưng nó khác với nhu cầu trả phí ổn định trong môi trường sản xuất.
Kết luận chặt chẽ hơn là: V4 Flash đã đạt mức độ phân phối và thử nghiệm cực nhanh. Bằng chứng hiện có chưa đủ để khẳng định toàn bộ lưu lượng ban đầu là do người dùng chuyển đổi sang sử dụng trả phí hoặc đã triển khai lâu dài trong sản xuất.
Giá thay đổi theo nhà cung cấp, tuyến truy cập, ưu đãi, trạng thái bộ nhớ đệm và thời điểm. Các bài viết về đợt phát hành ngày 31/7 dẫn mức giá API chính thức là 0,14 USD cho một triệu token đầu vào không dùng cache và 0,28 USD cho một triệu token đầu ra; trong khi OpenRouter từng hiển thị các mức giá theo tuyến khác nhau vào đầu tháng 8. 3
Trên trang niêm yết OpenRouter về sau cho tuyến có định danh deepseek-v4-flash-0731, giá là 0,05 USD cho một triệu token đầu vào, 0,16 USD cho một triệu token đầu ra và 0,013 USD cho một triệu token đọc từ cache. 1
Dựa trên các mức giá OpenRouter này, chênh lệch với giá được nêu trong nguồn so sánh là rất lớn:
| Model | Giá niêm yết đầu vào / đầu ra cho 1 triệu token | So với V4-Flash ở mức 0,05 / 0,16 USD |
|---|---|---|
| DeepSeek V4-Flash-0731 | 0,05 / 0,16 USD |
Mốc tham chiếu |
| Kimi K3 | 3 / 15 USD |
Cao hơn khoảng 60 lần / 94 lần |
| GPT-5.6 Sol | 5 / 30 USD |
Cao hơn khoảng 100 lần / 188 lần |
| Claude Fable 5 | 10 / 50 USD |
Cao hơn khoảng 200 lần / 313 lần |
Đây chỉ là phép so sánh số học giữa giá niêm yết, không phải bằng chứng rằng các model có chất lượng, tốc độ, độ tin cậy khi gọi công cụ, hành vi an toàn hoặc thời gian hoạt động tương đương. Chúng cũng không tạo ra một “chi phí trên mỗi tác vụ” áp dụng cho mọi trường hợp. Hóa đơn thực tế phụ thuộc vào lượng token đầu vào và đầu ra, cache, số lần thử lại, lượt gọi công cụ, nhà cung cấp và tần suất quy trình phải chuyển sang model khác.
Kimi K3, GPT-5.6 Sol và Claude Fable 5 không nên bị coi là có thể thay thế hoàn toàn cho nhau chỉ vì đều hướng đến lập trình nâng cao và tác tử AI. Nguồn so sánh mô tả Kimi K3 là model MoE 2,8 nghìn tỷ tham số với ngữ cảnh một triệu token; GPT-5.6 Sol có ngữ cảnh 1,05 triệu token, còn Claude Fable 5 là một triệu token. 17
Với bên mua, khác biệt hữu ích nằm ở vận hành thay vì tranh luận về thương hiệu:
Các benchmark công khai có thể giúp lập danh sách rút gọn, nhưng một điểm số đơn lẻ không thể quyết định model mặc định cho môi trường sản xuất. So sánh “Agent Ultimate” 25,2 so với 25,7 trong nhận định ban đầu không được các nguồn có tính перв cấp trong dữ liệu cung cấp xác thực độc lập, nên không nên dùng làm bằng chứng về sự tương đương gần như hoàn toàn. Tài liệu phát hành của DeepSeek có nêu các điểm như 82,7 trên Terminal Bench 2.1 và 54,2 trên NL2Repo, nhưng kết quả benchmark vẫn cần được kiểm chứng bằng đúng khối lượng công việc của từng tổ chức. 10
Với một đội phát triển quy mô vừa, câu hỏi hiếm khi là “model nào đứng đầu bảng?” Thay vào đó là: Model nào đủ tin cậy trên công việc thực tế để tiết kiệm đủ chi phí, sau khi đã tính chi phí định tuyến và thất bại?
Một quy trình đánh giá thực tế nên gồm:
Đó là lý do đà tăng của V4-Flash vẫn đáng chú ý, kể cả khi số token ban đầu được thúc đẩy bởi các chương trình dùng thử. Nó cho thấy một nền tảng tổng hợp như OpenRouter có thể giúp lập trình viên gần như ngay lập tức thử một lựa chọn ngữ cảnh dài với chi phí rất thấp. Nếu model đạt yêu cầu trong đánh giá sản xuất, nó có thể kéo khối lượng tác vụ thường nhật rời khỏi các lựa chọn mặc định đắt hơn.
Dữ liệu được cung cấp ủng hộ việc DeepSeek V4 Flash dẫn đầu OpenRouter với 7,22 nghìn tỷ token trong tuần, sự chồng lấp với giai đoạn preview trước đó và thành phần dùng thử miễn phí được báo cáo trên OpenCode. 3
5 Tuy nhiên, dữ liệu này chưa xác thực đầy đủ các tuyên bố rằng model Trung Quốc chiếm 9 trong 10 vị trí đầu, vượt lưu lượng gọi của Mỹ trong 14 tuần liên tiếp, dẫn đến làn sóng chuyển dịch rộng khắp của lập trình viên Mỹ và châu Âu, tạo ra mức giảm chi phí suy luận thực tế 60–85%, hoặc buộc GPT-5.6 Luna giảm giá 80%.
Các nhận định đó cần dữ liệu trực tiếp từ bảng điều khiển OpenRouter, hồ sơ giá của nhà cung cấp hoặc nghiên cứu khối lượng công việc có thể tái lập. Với bằng chứng hiện có, kết luận phù hợp hơn là: DeepSeek V4-Flash kết hợp giá định tuyến niêm yết rất thấp, cửa sổ ngữ cảnh lớn và khả năng tiếp cận rộng đúng vào lúc lập trình viên sẵn sàng thử các model tác tử và lập trình rẻ hơn. Chỉ riêng các điều kiện đó đã đủ tạo ra một đợt tăng sử dụng nhanh — nhưng chưa đủ để chứng minh một cuộc tái định hình thị trường lâu dài.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
DeepSeek V4 Flash đứng đầu bảng xếp hạng sử dụng theo tuần của OpenRouter giai đoạn 27/7–2/8 với 7,22 nghìn tỷ token, nhưng tuần này bao gồm cả thời gian trước khi bản 0731 phát hành chính thức.
DeepSeek V4 Flash đứng đầu bảng xếp hạng sử dụng theo tuần của OpenRouter giai đoạn 27/7–2/8 với 7,22 nghìn tỷ token, nhưng tuần này bao gồm cả thời gian trước khi bản 0731 phát hành chính thức. Trên tuyến DeepSeek V4 Flash 0731, OpenRouter niêm yết giá 0,05 USD cho một triệu token đầu vào và 0,16 USD cho một triệu token đầu ra, cùng cửa sổ ngữ cảnh 1.310.720 token.
Lưu lượng dùng thử miễn phí có thể đã đóng góp lớn vào đợt tăng trưởng: OpenCode được báo cáo xử lý 8 nghìn tỷ token cho model trong ngày 1/8, trong đó 5 nghìn tỷ token đến từ thử miễn phí.