| V4-Flash | Ngoài cao điểm | $0,007 | $0,22 | $0,66 |
| V4-Flash | Cao điểm | $0,014 | $0,44 | $1,32 |
| V4-Pro | Ngoài cao điểm | $0,022 | $0,66 | $1,98 |
| V4-Pro | Cao điểm | $0,044 | $1,32 | $3,96 |
Mức tăng cụ thể phụ thuộc vào mô hình, loại token, trạng thái bộ nhớ đệm và thời điểm sử dụng. Reuters mô tả mức điều chỉnh dao động từ 50% đến 1.100% so với giá cũ.
Tác động rõ nhất thuộc về các hệ thống tạo lượng output lớn trong giờ cao điểm. Giá output của V4-Pro tăng từ $0,87 lên $1,98 cho mỗi triệu token ở ngoài cao điểm và $3,96 trong giờ cao điểm. Vì vậy, một tác nhân lập trình tạo 10 triệu token output mỗi tháng sẽ tốn khoảng $8,70 theo giá cũ, khoảng $19,80 nếu toàn bộ hoạt động diễn ra ngoài cao điểm hoặc khoảng $39,60 nếu rơi vào các khung cao điểm — chưa tính phí token đầu vào.
Với cơ chế mới, thời điểm gửi yêu cầu trở thành một phần của bài toán quản lý chi phí API. Các công việc không cần phản hồi ngay như xử lý theo lô, chạy tác nhân lập trình, đánh giá mô hình hoặc tạo dữ liệu có thể được chuyển sang 17 giờ ngoài cao điểm mỗi ngày.
Ngược lại, các ứng dụng tương tác khó linh hoạt hơn vì yêu cầu phát sinh đúng lúc người dùng cần câu trả lời. Doanh nghiệp cũng sẽ phải quan tâm nhiều hơn đến việc tăng tỷ lệ cache hit, chuyển tác vụ thông thường sang V4-Flash hoặc định tuyến một phần lưu lượng sang nhà cung cấp khác.
Điều đó biến lựa chọn mô hình thành quyết định vận hành liên tục, thay vì chỉ là một lần so sánh điểm benchmark và bảng giá. Các yếu tố như độ trễ, khả năng định tuyến, hành vi bộ nhớ đệm và chi phí chuyển đổi nhà cung cấp đều có thể ảnh hưởng đến hóa đơn thực tế.
Việc tăng giá không xóa bỏ sức hút chi phí của DeepSeek, nhưng thu hẹp lợi thế từng được tạo ra bởi mức suy luận đặc biệt rẻ. Cách tính phí theo cao điểm cũng phù hợp với một nhà cung cấp đang cố gắng quản lý nhu cầu và thu nhiều giá trị hơn từ công suất tính toán khan hiếm. Tuy nhiên, các tài liệu công khai trong phạm vi bài viết này chưa chứng minh DeepSeek đã có lãi hoặc đã xác lập được con đường rõ ràng tới lợi nhuận, nên đây vẫn chỉ là một nhận định thận trọng.
OpenAI chọn hướng đi khác. Ngày 6 tháng 8, công ty thông báo GPT-5.6 Luna sẽ trở thành mô hình mặc định cho người dùng ChatGPT Free và Go, thay thế GPT-5.5. Hai nhóm người dùng này cũng được cung cấp chat văn bản hằng ngày không giới hạn và tùy chọn Think cho các câu hỏi khó hơn, với các biện pháp ngăn lạm dụng đi kèm.
Tuy nhiên, “không giới hạn” ở đây không có nghĩa toàn bộ ChatGPT đều không bị giới hạn. OpenAI vẫn áp dụng hạn mức riêng cho tải tệp, tạo ảnh và các công cụ khác. Người dùng Free và Go cũng không được truy cập GPT-5.6 Sol; Luna là mô hình mặc định và đảm nhiệm tính năng Think cho hai gói này.
Luna được định vị là thành viên tiết kiệm hơn trong gia đình GPT-5.6, thay vì mô hình cao cấp Sol. Một số nguồn bên thứ ba đưa ra mức giá API là $0,20 cho mỗi triệu token đầu vào và $1,20 cho mỗi triệu token đầu ra, nhưng các con số này chưa được những nguồn có thẩm quyền cao nhất trong tài liệu cung cấp xác nhận.
Điểm khác biệt chiến lược quan trọng hơn nằm ở chỗ: Luna gần như miễn phí khi dùng để chat văn bản trong ChatGPT Free và Go, còn quyền truy cập API vẫn là một sản phẩm trả phí riêng.
Các quyết định về giá và quyền truy cập xuất hiện trong bối cảnh các mô hình Trung Quốc đang thu hút lượng lớn lưu lượng từ giới phát triển. Bloomberg cho biết các mô hình Trung Quốc đã vượt các nền tảng Mỹ trên OpenRouter vào tháng 6 và chiếm hơn 60% thị phần token trong tháng tiếp theo.
OpenRouter là nền tảng cho phép nhà phát triển định tuyến yêu cầu qua nhiều mô hình AI. Vì vậy, dữ liệu của nền tảng là chỉ báo hữu ích về hành vi lựa chọn mô hình trong cộng đồng phát triển, nhưng không thể xem là thước đo đầy đủ cho mức sử dụng AI trên toàn cầu.
Đà tăng này cũng không chỉ đến từ DeepSeek. Bảng xếp hạng OpenRouter tháng 7 đưa các mô hình do Trung Quốc phát triển vào cả năm vị trí dẫn đầu về khối lượng token: MiMo-V2.5 của Xiaomi, DeepSeek, MiniMax, dòng Qwen của Alibaba và Kimi của Moonshot. Một phân tích khác xác định DeepSeek là nhà cung cấp đơn lẻ lớn nhất trên nền tảng, với 17,6% trong một bảng xếp hạng tháng 6.
Mẫu hình này giải thích vì sao giá token vẫn là yếu tố trung tâm. Các tác vụ lập trình và tác nhân AI sử dụng nhiều token thường ưu tiên những mô hình đủ rẻ để chạy lặp đi lặp lại. Nhưng phản ứng của OpenAI cho thấy thị phần có thể giành được không chỉ bằng giá API: đưa một mô hình đủ năng lực đến tay người dùng miễn phí giúp hình thành thói quen, tạo phản hồi và mở đường cho việc chuyển đổi sang các sản phẩm trả phí.
DeepSeek và OpenAI đang xử lý hai mặt của cùng một sức ép thị trường:
Vì thế, cuộc chiến giá AI chưa kết thúc chỉ vì một số mức giá tăng. Cạnh tranh đang tách thành nhiều lớp: suy luận giá thấp và khả năng tiếp cận mô hình mở ở một phía; độ phủ người dùng, tích hợp sản phẩm, năng lực cao cấp và công cụ kiểm soát doanh nghiệp ở phía còn lại.
Việc DeepSeek tăng giá nhắc nhở thị trường rằng giá API thấp có thể thu hút lượng sử dụng khổng lồ nhưng không bảo đảm chi phí sẽ luôn thấp. Ngược lại, việc OpenAI đưa Luna vào gói miễn phí là một canh bạc về phân phối: công ty trợ giá cho trải nghiệm người dùng phổ thông để củng cố vị thế, sau đó tạo khác biệt bằng các tầng mô hình và tính năng ngoài văn bản.
Bài học thực tế cho nhà phát triển và doanh nghiệp là không nên xem bất kỳ bảng giá hay benchmark nào là cố định vĩnh viễn. Chi phí có thể thay đổi theo nhu cầu, tầng mô hình, trạng thái cache và thời điểm trong ngày.
Một kiến trúc bền vững hơn sẽ cần đo lường workload thực tế, duy trì nhiều lựa chọn định tuyến và phân công từng tác vụ cho mô hình hoặc gói truy cập phù hợp với mức rủi ro kinh doanh cũng như ngân sách.