Nói cách khác, việc giảm giá không biến Sol thành mẫu giá rẻ. Nó làm giảm chi phí sử dụng mẫu cao cấp, đặc biệt với các hệ thống tạo nhiều token đầu ra, nhưng khoảng cách giữa Sol và hai mẫu còn lại vẫn đáng kể.
OpenRouter hiện hiển thị GPT-5.6 Sol ở mức 2 USD/triệu token đầu vào và 10 USD/triệu token đầu ra—bằng một nửa mức giá trực tiếp mới của OpenAI.
Đây có thể là một phương án mua sắm đáng chú ý với các nhóm phát triển muốn giảm chi phí hoặc tránh phụ thuộc vào một điểm truy cập duy nhất. Tuy nhiên, không nên mặc định mức giá trên là bảng giá chung, lâu dài của OpenAI. Giá qua nền tảng trung gian có thể phụ thuộc vào nhà cung cấp, tuyến định tuyến, chương trình khuyến mại, điều kiện không sử dụng khóa API riêng (BYOK), giới hạn tốc độ và chính sách lưu lượng tại từng thời điểm.
Vì vậy, phép so sánh công bằng cần kiểm tra cả phiên bản mô hình, chất lượng định tuyến, thời gian phản hồi, giới hạn hạn mức, chính sách dữ liệu và cách tính bộ nhớ đệm—không chỉ nhìn vào giá mỗi triệu token.
Amazon Web Services đã đưa GPT-5.6 Sol, Terra và Luna lên endpoint bedrock-runtime, hỗ trợ các API Responses, Converse và Chat Completions, đồng thời bổ sung suy luận liên vùng theo địa lý và liên vùng toàn cầu.
global. có thể chuyển yêu cầu đến bất kỳ AWS Region thương mại nào được hỗ trợ, dựa trên năng lực thực tế. Đây là phương án tận dụng vùng công suất rộng nhất khi tổ chức không bị ràng buộc phải xử lý dữ liệu trong một khu vực cụ thể. Điểm đáng chú ý là ứng dụng trên đường dẫn bedrock-runtime cần sử dụng inference profile ID, chẳng hạn us.openai.gpt-5.6-sol hoặc global.openai.gpt-5.6-sol, thay vì chỉ gọi model ID nội vùng. Hồ sơ này đồng thời xác định cách AWS cấp quyền và định tuyến yêu cầu.
AWS công bố hạn mức suy luận liên vùng cho GPT-5.6 Sol là 10 triệu token mỗi phút tại mỗi Region được hỗ trợ. Hạn mức này tính tổng token đầu vào và đầu ra trong các yêu cầu gửi qua những API suy luận tương ứng.
Trên Bedrock, cả ba mẫu Sol, Terra và Luna hỗ trợ đầu vào văn bản và hình ảnh, đầu ra văn bản, bộ nhớ đệm prompt và cửa sổ ngữ cảnh lên tới 1 triệu token. AWS cũng phân tách mức giá cho bậc ngữ cảnh ngắn 272.000 token.
Với Sol, giá Bedrock còn thay đổi theo cách định tuyến. Ở bậc ngữ cảnh ngắn, hồ sơ Global cross-Region có giá 5 USD/triệu token đầu vào và 30 USD đầu ra; In-Region và Geo cross-Region có giá 5,50 USD đầu vào và 33 USD đầu ra.
Diễn biến của GPT-5.6 cho thấy cạnh tranh giữa các mẫu AI hàng đầu đang chuyển từ câu hỏi “mẫu nào thông minh hơn?” sang “mẫu nào đem lại chi phí vận hành tốt hơn?”. OpenAI trước tiên giảm mạnh Luna và giảm vừa phải Terra, sau đó hạ giá Sol khi các kênh thay thế đã đưa ra mức chiết khấu đáng kể.
OpenAI cho biết những cải thiện về hiệu năng trên mỗi đơn vị chi phí là cơ sở để giảm giá Luna và Terra, đồng thời tăng tốc Sol. Điều này cho thấy hiệu quả runtime và suy luận đang được chuyển một phần thành giá thấp hơn hoặc tốc độ cao hơn cho khách hàng, thay vì chỉ được giữ lại dưới dạng biên lợi nhuận.
Với doanh nghiệp, Amazon Bedrock và các lớp định tuyến trung gian còn mang lại lợi ích ngoài giá token: hóa đơn và quyền truy cập IAM tích hợp với AWS, lựa chọn xử lý trong một Region hoặc trong một khu vực địa lý, cùng khả năng chuyển hướng khi một Region bị nghẽn hoặc gặp sự cố. Đổi lại, định tuyến toàn cầu có thể không phù hợp với dữ liệu phải ở trong một địa bàn pháp lý cụ thể.
Do đó, chiến lược mua sắm hợp lý không chỉ là chọn endpoint rẻ nhất. Doanh nghiệp nên thử nghiệm OpenAI trực tiếp, Bedrock và các nền tảng tổng hợp sau khi kiểm tra điều khoản hợp đồng, cách xử lý dữ liệu, tính tương đương của phiên bản mô hình, hạn mức tốc độ, cơ chế caching và yêu cầu tuân thủ khi tự động chuyển yêu cầu giữa các Region.