| Kích thước yêu cầu | Đầu vào | Đầu vào đã lưu trong bộ nhớ đệm | Đầu ra |
|---|---|---|---|
| Dưới 200.000 token đầu vào | 2 USD | 0,50 USD | 6 USD |
| Từ 200.000 token trở lên | 4 USD | 1 USD | 12 USD |
Các mức giá trên được tính cho mỗi 1 triệu token. Điểm cần đặc biệt lưu ý là khi yêu cầu chạm ngưỡng 200.000 token, toàn bộ yêu cầu được áp dụng mức giá ngữ cảnh dài. Những đội ngũ xây dựng tác tử thường xuyên gửi cả kho mã nguồn, tài liệu lớn hoặc lịch sử hội thoại dài nên lập mô hình chi phí dựa trên ngưỡng này, thay vì chỉ dự toán theo mức giá quảng bá 2 USD cho đầu vào và 6 USD cho đầu ra.
Bộ nhớ đệm có thể giảm phần chi phí đầu vào, nhưng không loại bỏ nhu cầu kiểm soát độ phình của ngữ cảnh. Thiết kế triển khai thực tế nên theo dõi kích thước prompt, tỷ lệ tái sử dụng bộ nhớ đệm, độ dài đầu ra và mức cải thiện chất lượng trước khi mở rộng ngân sách ngữ cảnh.
xAI cho biết Grok 4.6 đạt 70,8% trên CursorBench 3.2 khi sử dụng chế độ “extra high thinking”, so với mức 70,5% được báo cáo cho Fable 5 Max. Công ty đồng thời tuyên bố chi phí cho mỗi tác vụ hoàn tất thấp hơn khoảng sáu lần.
Đây là một tuyên bố đáng chú ý khi ra mắt, nhưng khoảng cách chỉ là 0,3 điểm phần trăm và kết quả đến từ phép so sánh benchmark do nhà cung cấp báo cáo. Vì vậy, con số này nên được xem là tín hiệu để kiểm thử thêm, không phải bằng chứng rằng Grok 4.6 sẽ vượt trội trên kho mã nguồn, bộ công cụ, yêu cầu độ trễ hay tiêu chuẩn độ tin cậy riêng của mọi doanh nghiệp.
Các bảng so sánh được công bố cũng cho thấy kết quả có thể khác nhau tùy benchmark và cấu hình. Một bảng khác ghi nhận Grok 4.6 đạt 69,9% trên CursorBench. Prompt, bộ công cụ đánh giá, cài đặt mô hình và thời điểm đo đều có thể ảnh hưởng đến kết quả. Bên mua nên tái hiện phép so sánh trên những tác vụ đại diện cho môi trường thực tế của mình.
Grok 4.6 được cung cấp qua API của xAI và nhanh chóng xuất hiện trên nhiều kênh dành cho nhà phát triển và đám mây, gồm Cursor, GitHub Copilot, Amazon Bedrock, OpenRouter, Vercel và Cloudflare. Amazon công bố Grok 4.6 trên Bedrock vào ngày 19 tháng 8, một tuần sau lần phát hành ban đầu.
Vertex AI mang đến một kiểu điểm truy cập khác. Với khách hàng Google Cloud, lợi ích không chỉ là một endpoint mới, mà còn là khả năng đánh giá mô hình bên trong hệ thống kiểm soát và môi trường mua sắm công nghệ mà họ đã sử dụng. Điều này có thể giúp các đội ngũ tiếp tục quản lý thử nghiệm AI, quyền truy cập và ngân sách qua Google Cloud, thay vì thiết lập một quy trình hoàn toàn tách biệt.
Đổi lại, việc dùng mô hình qua một marketplace được quản lý không làm biến mất bài toán lựa chọn mô hình. Doanh nghiệp vẫn cần kiểm tra khả năng cung cấp theo khu vực, hạn mức, cách xử lý dữ liệu, kỳ vọng dịch vụ, hành vi khi gọi công cụ, khả năng quan sát và các tình huống lỗi trước khi chuyển từ thử nghiệm sang sản xuất. Việc Grok 4.6 trên nền tảng Google đang ở giai đoạn Preview cũng là lý do để coi những triển khai đầu tiên là các đợt đánh giá có kiểm soát, thay vì mặc định rằng dịch vụ sẽ luôn giữ nguyên trạng thái và đặc tính vận hành.
Một quy trình đánh giá thực tế nên tập trung vào bốn nhóm tiêu chí:
Việc Grok 4.6 xuất hiện trên Vertex AI có ý nghĩa nhiều hơn một con số benchmark đơn lẻ. xAI đang đưa mô hình đến những nơi nhà phát triển đã làm việc — từ API và IDE đến nền tảng AI được lưu trữ và marketplace đám mây. Grok 4.6 kết hợp cửa sổ ngữ cảnh lớn, các tính năng hướng đến tác tử và mức giá ban đầu có sức hút cho thử nghiệm, trong khi tốc độ mở rộng sang nhiều kênh làm giảm chi phí chuyển đổi khi bắt đầu dùng thử.
Đối với bên mua trong doanh nghiệp, lập luận thuyết phục nhất vẫn có điều kiện: Grok 4.6 hiện dễ đánh giá hơn trong môi trường Google Cloud, nhưng giá trị thực tế sẽ phụ thuộc vào kết quả trên từng loại tác vụ, hiệu quả kinh tế của các yêu cầu ngữ cảnh dài và mức độ phù hợp của dịch vụ Preview với yêu cầu quản trị. Lợi thế 0,3 điểm phần trăm trên benchmark đáng để kiểm chứng — nhưng chưa nên được xem là ưu thế bền vững.