DeepSeek bắt đầu tính giá theo thời điểm cho V4 Flash và V4 Pro từ 0 giờ ngày 17/8/2026 theo giờ Bắc Kinh, cũng là giờ Việt Nam; giá thấp điểm bằng một nửa giá cao điểm. Giờ cao điểm là 9:00–12:00 và 14:00–18:00 mỗi ngày.
Câu trả lời nghiên cứu

Create a landscape editorial hero image for this Studio Global article: What changed when DeepSeek’s new API pricing for DeepSeek-V4-Flash and DeepSeek-V4-Pro took effect at midnight on August 17, 2026—including. Article summary: At 00:00 Beijing time on August 17 (16:00 UTC on August 16), DeepSeek replaced flat V4 API pricing with time-of-use pricing: off-peak rates are exactly half peak rates. Peak is 09:00–12:00 and 14:00–18:00 Beijing time da. Topic tags: general, news, documentation, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, waterm
DeepSeek đã chuyển API của hai mô hình DeepSeek-V4-Flash và DeepSeek-V4-Pro từ bảng giá cố định sang cơ chế tính phí theo giờ. Chính sách có hiệu lực lúc 0:00 ngày 17/8/2026 theo giờ Bắc Kinh, tương đương 23:00 ngày 16/8 theo giờ Việt Nam và 16:00 UTC ngày 16/8. Giá ngoài giờ cao điểm bằng đúng một nửa giá cao điểm. 1
2
Với các nhóm phát triển phần mềm, thay đổi này có nghĩa chi phí không còn chỉ phụ thuộc vào việc chọn mô hình và số token. Thời điểm gửi yêu cầu, khả năng tái sử dụng nội dung đầu vào và độ dài câu trả lời cũng ảnh hưởng trực tiếp đến hóa đơn.
DeepSeek quy định hai khoảng cao điểm mỗi ngày:
Các thời gian còn lại được tính là thấp điểm. Vì Việt Nam cùng múi giờ UTC+8 với Bắc Kinh, các mốc trên có thể được áp dụng trực tiếp khi lập lịch tác vụ từ Việt Nam.
Mức phí của từng yêu cầu được xác định theo thời điểm máy chủ nhận yêu cầu, không phải thời điểm xử lý xong. Nếu yêu cầu đến hệ thống trong giờ cao điểm, toàn bộ yêu cầu được tính theo giá cao điểm. 2
7
Các mức dưới đây tính bằng nhân dân tệ trên mỗi một triệu token. “Cache hit” là đầu vào có thể sử dụng phần tiền tố đã được lưu trong bộ nhớ đệm; “cache miss” là đầu vào chưa được lưu và phải xử lý ở mức giá cao hơn.
| Mô hình và loại token | Giá cũ | Thấp điểm | Thay đổi so với giá cũ | Cao điểm | Thay đổi so với giá cũ |
|---|---|---|---|---|---|
| V4-Flash, đầu vào cache hit | ¥0,02 | ¥0,05 | +150% | ¥0,10 | +400% |
| V4-Flash, đầu vào cache miss | ¥1,00 | ¥1,50 | +50% | ¥3,00 | +200% |
| V4-Flash, đầu ra | ¥2,00 | ¥4,50 | +125% | ¥9,00 | +350% |
| V4-Pro, đầu vào cache hit | ¥0,025 | ¥0,15 | +500% | ¥0,30 | +1.100% |
| V4-Pro, đầu vào cache miss | ¥3,00 | ¥4,50 | +50% | ¥9,00 | +200% |
| V4-Pro, đầu ra | ¥6,00 | ¥13,50 | +125% | ¥27,00 | +350% |
Bảng giá V4-Flash được công bố ở mức ¥0,05, ¥1,50 và ¥4,50 trong giờ thấp điểm cho đầu vào cache hit, đầu vào cache miss và đầu ra; các mức này tăng lên ¥0,10, ¥3 và ¥9 trong giờ cao điểm. 2 Theo Reuters, mức tăng mới trên toàn bộ mô hình và loại token dao động từ 50% đến 1.100%, tùy thời điểm sử dụng.
1
8
Các công việc như chạy đánh giá, lập chỉ mục tài liệu, xử lý bù dữ liệu, tạo dữ liệu tổng hợp và những tác vụ không cần phản hồi ngay có thể được đưa vào hàng đợi ngoài hai khung giờ cao điểm.
Do giá thấp điểm chỉ bằng 50% giá cao điểm, việc lập lịch có thể giúp giảm đáng kể chi phí mà không cần đổi mô hình hay cắt giảm ngân sách token. Hệ thống hàng đợi chỉ cần biết thời hạn hoàn thành và lịch tính phí theo giờ Bắc Kinh để trì hoãn các công việc linh hoạt. 2
Chat hỗ trợ khách hàng, trợ lý lập trình và các tác nhân AI thời gian thực thường phải hoạt động khi người dùng đang trực tuyến. Những hệ thống này có thể vẫn phải chịu giá cao điểm, nhưng còn nhiều cách giảm chi phí:
Cache hit đặc biệt đáng chú ý vì đầu vào dạng này vẫn rẻ hơn rất nhiều so với cache miss ở cả hai mô hình. Với các hệ thống liên tục gửi cùng một bộ hướng dẫn hoặc tài liệu nền, tăng tỷ lệ cache hit có thể hiệu quả hơn việc chỉ giảm số lượng yêu cầu.
Các tác vụ tạo chuỗi suy luận dài, báo cáo, mã nguồn hoặc câu trả lời chi tiết tiêu thụ nhiều token đầu ra. Trong giờ cao điểm, mỗi một triệu token đầu ra có giá ¥9 trên Flash và ¥27 trên Pro.
Các nhóm phát triển có thể đặt giới hạn đầu ra chặt chẽ hơn, sử dụng Flash cho những lượt hỏi thường nhật và dành Pro cho các nhiệm vụ mà năng lực bổ sung đủ để biện minh cho mức phí cao hơn. 1
2
Giá đầu vào cache hit của V4-Pro trong giờ cao điểm cao gấp 12 lần mức giá cố định trước đây, tương đương mức tăng 1.100%—cao nhất trong bảng giá mới. Dù giá tuyệt đối vẫn thấp hơn nhiều so với đầu vào cache miss và token đầu ra, thay đổi này đáng kể đối với các ứng dụng có khối lượng cực lớn và thường xuyên sử dụng prompt được lưu đệm. 1
19
Đợt thay đổi giá diễn ra sau khi DeepSeek-V4-Pro-0813 được đưa vào sử dụng rộng rãi trong tháng 8 thông qua endpoint deepseek-v4-pro. Các thông số được công bố mô tả đây là mô hình văn bản có cửa sổ ngữ cảnh một triệu token, khả năng tạo tối đa 384.000 token và kiến trúc mixture-of-experts với khoảng 1,6 nghìn tỷ tham số tổng cộng, trong đó khoảng 49 tỷ tham số được kích hoạt cho mỗi token. 29
33
DeepSeek cũng phân biệt giới hạn số yêu cầu đồng thời giữa hai dòng:
Một yêu cầu chiếm một suất xử lý cho đến khi hoàn tất, bao gồm cả trường hợp trả kết quả theo luồng. 28
Kết hợp giữa mức giá và giới hạn đồng thời, có thể thấy Flash phù hợp hơn với lưu lượng thường nhật cần thông lượng cao, còn Pro được định vị cho các tác vụ suy luận khó và xử lý ngữ cảnh lớn hơn. Đây là suy luận từ cơ cấu giá và giới hạn được công bố, không phải tuyên bố áp dụng cho mọi trường hợp sử dụng. 2
28
Động thái của DeepSeek giống một hình thức điều tiết nhu cầu sử dụng GPU cho suy luận AI. Nhu cầu thường tập trung vào thời điểm người dùng tương tác nhiều, trong khi các công việc theo lô có thể chờ. Tăng giá vào các khung giờ đó và giảm giá ở thời gian khác tạo động lực dàn đều tải xử lý trong ngày.
Với nhà phát triển, bài toán tối ưu nay bao gồm nhiều câu hỏi hơn:
Trong cuộc đua giá của các mô hình ngôn ngữ lớn, đây là dấu hiệu cho thấy thị trường có thể đang dịch chuyển từ cạnh tranh bằng một bảng giá thấp đồng nhất sang định giá theo mức độ khan hiếm của năng lực tính toán. DeepSeek vẫn duy trì một “làn giá rẻ” cho nhu cầu có thể trì hoãn, nhưng đồng thời làm cho chi phí suy luận cao cấp phụ thuộc nhiều hơn vào thời điểm sử dụng. Reuters mô tả đây là một đợt tăng đáng kể, thay đổi theo mô hình, loại token và thời gian sử dụng—không phải một khoản phụ phí đồng loạt. 1
Bài học thực tế cho các đội ngũ đang dùng DeepSeek V4 khá rõ ràng: hãy coi lập lịch, bộ nhớ đệm, điều phối mô hình và giới hạn đầu ra là các phần của cùng một bài toán chi phí API. Tác vụ không thể dời lịch có thể cần chuyển sang mô hình khác hoặc giảm ngân sách token; tác vụ có thể chờ thì vẫn có cơ hội giữ hiệu quả kinh tế bằng cách chạy ngoài giờ cao điểm.
Studio Global AI
Trang này bao gồm câu trả lời dựa trên nguồn mà bạn có thể tiếp tục bên trong Studio Global.
DeepSeek bắt đầu tính giá theo thời điểm cho V4 Flash và V4 Pro từ 0 giờ ngày 17/8/2026 theo giờ Bắc Kinh, cũng là giờ Việt Nam; giá thấp điểm bằng một nửa giá cao điểm.
DeepSeek bắt đầu tính giá theo thời điểm cho V4 Flash và V4 Pro từ 0 giờ ngày 17/8/2026 theo giờ Bắc Kinh, cũng là giờ Việt Nam; giá thấp điểm bằng một nửa giá cao điểm. Giờ cao điểm là 9:00–12:00 và 14:00–18:00 mỗi ngày. Giá đầu ra cao nhất lần lượt là 9 nhân dân tệ cho V4 Flash và 27 nhân dân tệ cho V4 Pro trên mỗi triệu token.
Lập lịch tác vụ, tăng tỷ lệ cache hit, chọn Flash thay vì Pro khi phù hợp và giới hạn độ dài đầu ra nay là các quyết định gắn liền với chi phí API.