Ngược lại, Gemini 3.7 Flash của Google, phát hành ngày 13 tháng 8, ra mắt với mức giá giới thiệu là 0,75 USD mỗi triệu token đầu vào và 3,75 USD mỗi triệu token đầu ra — bằng một nửa giá của phiên bản tiền nhiệm Gemini 3.6 Flash, và chỉ bằng khoảng một phần ba chi phí của Grok 4.6 . Mức giá giới thiệu của Google kéo dài đến hết ngày 31 tháng 12 năm 2026, sau đó sẽ tăng gấp đôi
.
Sự tương phản về giá rất rõ rệt: Grok 4.6 cạnh tranh trực tiếp với các mô hình tiên phong như GPT-5.6 Sol và Claude Opus 5 về trí thông minh, trong khi Gemini 3.7 Flash được định vị như một mô hình tầm trung "workhorse" — mang hiệu suất tương đương Claude Sonnet 5 và GPT-5.6 Terra với chi phí thấp hơn đáng kể .
Grok 4.6 đạt 61 điểm trên Chỉ số Trí tuệ Nhân tạo (AA Intelligence Index) của Artificial Analysis, tổng hợp từ chín bài đánh giá . Điểm số này ngang với GPT-5.6 Sol Max, kém Claude Fable 5 Max một điểm (62) và kém Claude Opus 5 Max hai điểm (63) — đánh dấu lần đầu tiên một mô hình của xAI lọt vào nhóm tiên phong
.
| Bài chuẩn | Grok 4.6 (Cao) | Grok 4.5 (Cao) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI báo cáo Grok 4.6 đã cải thiện so với Grok 4.5 trên tất cả các bài đánh giá được liệt kê, bao gồm CursorBench, FrontierCode, APEX-Agents và Terminal-Bench . Kết quả kiểm thử độc lập của Artificial Analysis xác nhận các tuyên bố này trong phạm vi sai số 0,08 điểm, một kết quả không đáng kể
.
Đáng chú ý, kết quả độc lập mạnh nhất của Grok 4.6 nằm ở các bài đánh giá xử lý tri thức — mô hình này dẫn đầu về GDPval-AA v2 (1753 Elo), AA-Briefcase (1577) và bài chuẩn Harvey về pháp lý, cho thấy mô hình này đặc biệt phù hợp với các tác vụ tri thức chuyên nghiệp . Tuy nhiên, mặc dù được tiếp thị như một mô hình viết mã dạng tác tử (agentic coding model), điểm CursorBench v3.2 của nó (69,9%) vẫn xếp sau Fable 5 Max (70,5%), mặc dù nó vượt qua GPT-5.6 Sol Max (67,2%)
.
Về phần mình, Gemini 3.7 Flash cũng ghi nhận những bước tiến vững chắc trên các chuẩn viết mã và tác tử. Trên FrontierCode v1.1, nó đạt 43,6% cho khả năng tạo mã sẵn sàng sản xuất, tăng từ 34,4% của 3.6 Flash và vượt qua Claude Sonnet 5 (42,7%) và GPT-5.6 Terra (41,3%) . Nó cũng cho thấy những bước nhảy vọt lớn trên DeepSWE v1.1 (từ 49,0% lên 65,3%) và AutomationBench (từ 17,0% lên 30,4%)
.
Cải tiến kiến trúc chính của Grok 4.6 là cấp độ lập luận xhigh mới, một chế độ suy luận cường độ cao được thiết kế cho các tác vụ tác tử và viết mã khó nhất . Mô hình được tối ưu hóa cho độ bền của các tác tử chạy dài — nó giải quyết các tác vụ chỉ với khoảng một nửa số lượt mà Claude Opus 5 cần, hoặc khoảng một phần tư token đầu vào, ở mức giá niêm yết
. Ưu điểm về hiệu suất này được xem là điểm bán hàng mạnh mẽ nhất của nó đối với các nhà phát triển thực hiện các phiên viết mã kéo dài nhiều giờ
.
SpaceXAI cho biết những cải tiến của Grok 4.6 là nhờ vào một đợt huấn luyện bổ sung dài hơn, cùng với việc tinh chỉnh có giám sát (supervised fine-tuning) và học tăng cường (reinforcement learning) được cải thiện đáng kể — chứ không phải do tăng số lượng tham số . Mô hình này vẫn sử dụng cùng nền tảng V9 với 1,5 nghìn tỷ tham số như Grok 4.5
.
Trong khi đó, Gemini 3.7 Flash lại giới thiệu "cấu hình tư duy có thể tùy chỉnh" để kiểm soát sự kết hợp giữa chất lượng, chi phí và độ trễ, đồng thời là mô hình Google đầu tiên hỗ trợ xử lý video dạng tác tử (agentic video processing) .
Điểm mạnh của Grok 4.6:
Điểm yếu của Grok 4.6:
Hai ngày sau khi ra mắt, vào ngày 14 tháng 8 năm 2026, Grok 4.6 đã được triển khai trên GitHub Copilot trên tất cả các bề mặt phát triển chính :
Nhật ký thay đổi chính thức của GitHub mô tả nó là "được thiết kế cho việc mã hóa dạng tác tử và các quy trình công việc phức tạp, nhiều bước" . Việc tích hợp nhanh chóng này cho thấy nhu cầu mạnh mẽ từ nền tảng dành cho nhà phát triển đối với mô hình này .
Trình tự ra mắt vào ngày 12–13 tháng 8 cho thấy hai chiến lược cạnh tranh khác biệt:
Grok 4.6 (SpaceXAI) — $2/$6 mỗi MTok — Trình độ tiên phong (AA Index: 61) — Ngữ cảnh 500K — Được thiết kế cho viết mã tác tử và công việc tri thức — Lợi thế về hiệu suất tác vụ so với Opus 5
Gemini 3.7 Flash (Google) — $0.75/$3.75 mỗi MTok (giá giới thiệu) — Hiệu suất tầm trung, tương đương Claude Sonnet 5 và GPT-5.6 Terra — Ngữ cảnh 1M — Mô hình Gemini đầu tiên cho phép xử lý video dạng tác tử — Hỗ trợ Gemini Spark
Grok 4.6 cạnh tranh ở mức trí thông minh cao với giá chiết khấu so với các mô hình tiên phong, trong khi Gemini 3.7 Flash cạnh tranh về giá với mức chiết khấu so với phân khúc tầm trung. Quyết định của Google khi cung cấp Gemini 3.7 Flash với giá bằng một nửa mức giá giới thiệu của phiên bản tiền nhiệm — và từ chối công bố ngày phát hành cho mô hình Pro hàng đầu của mình — cho thấy một chiến lược có chủ đích nhằm chiếm thị phần ở phân khúc tầm trung .
Grok 4.6 đã đưa SpaceXAI trở lại nhóm tiên phong, ngang bằng với GPT-5.6 Sol về trí thông minh tổng hợp nhưng với chi phí thấp hơn đáng kể, cùng một lợi thế hiệu suất thực sự cho các tác vụ tác tử. Những hạn chế của nó — không dẫn đầu bất kỳ chuẩn viết mã đơn lẻ nào, xếp sau Claude Opus 5 về điểm trí thông minh tổng hợp và giữ nguyên giá trong khi đối thủ cắt giảm — là có thật nhưng không làm giảm đi thành tựu đạt được.
Phản ứng của Google, chỉ 24 giờ sau đó, đã làm thay đổi toàn bộ cuộc chơi về giá. Với chi phí chỉ bằng khoảng một phần ba Grok 4.6, Gemini 3.7 Flash cung cấp hiệu suất viết mã và tác tử mạnh mẽ ở một mức giá tầm trung — và kèm theo một cửa sổ ngữ cảnh lên tới 1 triệu token. Bối cảnh cạnh tranh hiện đã rõ ràng hơn bao giờ hết: trí thông minh tiên phong với giá chiết khấu (Grok 4.6) so với hiệu suất tầm trung với giá hời (Gemini 3.7 Flash).
Các nhà phát triển và doanh nghiệp phải đối mặt với một sự lựa chọn thực sự — không phải giữa tốt và xấu, mà là giữa hai đề xuất giá trị rất khác nhau. Việc Grok 4.6 nhanh chóng được tích hợp vào GitHub Copilot cho thấy ít nhất một trong số họ đã tìm thấy đối tượng của mình.