| GPT-5.6 Terra (cân bằng) | $2,00 | $12,00 | Giảm 20% từ $2,50/$15 |
| GPT-5.6 Sol (cao cấp) | $5,00 | $30,00 | Giữ nguyên nhưng có thêm chế độ Fast Mode cao cấp |
Giá kết hợp đầu vào và đầu ra của Luna đã giảm xuống còn 1,40 USD/triệu token, đưa nó trở thành một trong những mô hình tầm cao (frontier-class) rẻ nhất trên thị trường . Giá kết hợp của Terra là 14 USD/triệu token. Chế độ Fast của Sol cung cấp tốc độ nhanh hơn tới 2,5 lần so với xử lý Standard với mức giá gấp đôi giá Standard, nhưng không làm giảm chất lượng thông minh .
Khía cạnh đáng chú ý nhất của đợt giảm giá nằm ở câu chuyện kỹ thuật đằng sau nó. Vào ngày 29/7, OpenAI tiết lộ rằng GPT-5.6 Sol đã tự động viết lại và tối ưu hóa các kernel GPU trong sản xuất của chính mình — đoạn mã cấp thấp thực sự chạy các mô hình trên phần cứng .
Sử dụng môi trường phát triển Codex, GPT-5.6 Sol đã kết nối với cơ sở hạ tầng nội bộ của OpenAI, thiết kế và chạy hàng trăm thí nghiệm kiến trúc, triển khai và giám sát các bản triển khai, cũng như lặp lại kết quả . Mô hình đã học cú pháp trong Triton và Gluon, các ngôn ngữ lập trình được sử dụng trong stack kernel của OpenAI .
Kết quả có thể đo lường, được công bố bởi OpenAI, là :
Những lợi ích này là một phần của việc tối ưu hóa stack tổng thể. Các báo cáo cũng đề cập đến việc đại tu cân bằng tải (load balancing) — phân phối yêu cầu động dựa trên vị trí địa lý, loại bộ tăng tốc và khả năng sẵn sàng của bộ nhớ đệm — cũng như lưu trữ đệm truy vấn (prompt caching) với thời gian sống (TTL) khoảng 30 phút, giúp đầu vào được lưu trong bộ nhớ đệm rẻ hơn 90% so với đầu vào mới .
Quyết định giảm giá mạnh mẽ và nhanh chóng như vậy của OpenAI phản ánh một bối cảnh cạnh tranh đã thay đổi đáng kể chỉ trong vài tuần.
Kimi K3 của Moonshot AI (ra mắt ngày 17/7) là một mô hình mã nguồn mở (open-weight) với 2,8 nghìn tỷ tham số đến từ một startup ở Bắc Kinh, đã ngang bằng hoặc vượt qua GPT-5.6 Sol và Fable 5 của Anthropic trong các bài kiểm tra lập trình front-end . Trên bảng xếp hạng Frontend Code của Arena, Kimi K3 đạt 1.679 điểm, vượt qua cả GPT-5.6 Sol và Fable 5 . Một bài kiểm tra độc lập được công bố vào ngày 30/7 bởi Startrise AI Labs cho thấy Kimi K3 hòa với Claude Opus 5 của Anthropic trong một bài kiểm tra kỹ thuật front-end, nhưng với chi phí chỉ bằng một phần ba: 7,17 USD để chạy toàn bộ bài kiểm tra so với 21,17 USD của Opus 5 .
Kimi K3 trở thành mô hình AI mã nguồn mở lớn nhất thế giới, và Microsoft được cho là đã xem xét việc thay thế mô hình trong Copilot bằng nó, một động thái có thể giúp Microsoft tiết kiệm tới 600 triệu USD (60% mỗi token) .
Anthropic đã phát hành Claude Opus 5 vào ngày 24/7 với giá 5 USD/triệu token đầu vào — bằng một nửa giá của Fable 5 — và nó vượt qua Fable 5 trong một số điểm chuẩn . Điều này tạo thêm áp lực trực tiếp lên mức giá của GPT-5.6 Sol.
Google và Microsoft đều đã phát hành nhiều mô hình tiết kiệm chi phí trong tháng 7, gây thêm sức ép lên các phân khúc thị trường trung cấp và bình dân .
Bối cảnh cạnh tranh đã đẩy OpenAI phải định vị Luna như một 'sản phẩm dẫn dắt thua lỗ' để thu hút các khối lượng công việc lớn, nhạy cảm về giá, trong khi vẫn giữ Sol là sản phẩm khác biệt cao cấp .
Việc cắt giảm giá không diễn ra trong chân không. Các doanh nghiệp ngày càng yêu cầu các kiểm soát ngân sách cứng nhắc đối với chi tiêu AI, tương tự như cách họ quản lý chi phí đám mây.
Vào ngày 22/7/2026, OpenAI đã thêm giới hạn chi tiêu hàng tháng cứng (hard spend limits) có hiệu lực vào nền tảng API của mình . Không giống như các giới hạn mềm (soft caps) tháng 6 dành cho ChatGPT Enterprise (vốn chỉ là các tính năng quan sát trên bảng điều khiển), tính năng ngày 22/7 khiến cho các yêu cầu API trực tiếp bị lỗi với mã HTTP 429 khi ngân sách hàng tháng đã được cấu hình bị cạn kiệt . Quản trị viên có thể đặt giới hạn ở cấp độ tổ chức hoặc dự án, và giới hạn này được đặt lại vào đầu mỗi chu kỳ thanh toán .
Đây là phản ứng trực tiếp trước một vấn đề nan giải phổ biến. Nhiều nguồn tin cho biết Amazon và các doanh nghiệp lớn khác đang áp đặt các giới hạn chi tiêu nội bộ và phía khách hàng đối với chi phí AI khi các doanh nghiệp ngày càng xem xét kỹ lưỡng lợi tức đầu tư (ROI) . Mua sắm đã thay đổi: Reuters đưa tin rằng các doanh nghiệp quan tâm đến chi phí hiện đang coi AI 'giống như cách họ làm với đám mây' — với ngân sách riêng, phân bổ có giới hạn và các cổng phê duyệt cấp CIO cho các triển khai quy mô lớn .
Giới hạn chi tiêu cứng của OpenAI cung cấp cho doanh nghiệp một van an toàn chống lại chi phí đại lý vượt tầm kiểm soát, ngay cả khi công ty đồng thời đưa ra mức giá mỗi token thấp hơn. Thông điệp rất rõ ràng: kỷ nguyên 'chi bất kể điều gì cho AI' đã kết thúc.
Đối với các nhà phát triển và doanh nghiệp sử dụng API của OpenAI, những tác động trước mắt là tích cực:
Bài học rộng hơn: cuộc chiến giá AI là có thật, nó đang tăng tốc, và nó được thúc đẩy không chỉ bởi hiệu quả kỹ thuật — bao gồm kịch bản chưa từng có khi một mô hình tự tối ưu mã nguồn sản xuất của chính nó — mà còn bởi áp lực cạnh tranh. Các doanh nghiệp nên kỳ vọng giá sẽ tiếp tục giảm trên toàn ngành khi các kỹ thuật tự tối ưu hóa này trưởng thành và các mô hình mã nguồn mở tiếp tục thu hẹp khoảng cách về năng lực.