Sebaliknya, Gemini 3.7 Flash Google, yang dilancarkan pada 13 Ogos, diperkenalkan pada harga promosi $0.75 per juta token input dan $3.75 per juta token output — separuh harga pendahulunya, Gemini 3.6 Flash, dan kira-kira satu pertiga daripada kos Grok 4.6 . Harga promosi Google berkuat kuasa sehingga 31 Disember 2026, selepas itu ia akan berganda
.
Perbezaan harga adalah ketara: Grok 4.6 bersaing secara langsung dengan model peringkat hadapan seperti GPT-5.6 Sol dan Claude Opus 5 dari segi kepintaran, manakala Gemini 3.7 Flash diposisikan sebagai model "tier kerja harian" — menawarkan prestasi setanding Claude Sonnet 5 dan GPT-5.6 Terra pada kos yang jauh lebih rendah .
Grok 4.6 mencapai skor 61 pada Indeks Kepintaran Artificial Analysis (AA) , komposit sembilan penilaian . Ia mengikat GPT-5.6 Sol Max, ketinggalan satu mata di belakang Claude Fable 5 Max (62), dan dua mata di belakang Claude Opus 5 Max (63) — menandakan kali pertama model xAI menyertai kelompok hadapan
.
| Penanda Aras | Grok 4.6 (Tinggi) | Grok 4.5 (Tinggi) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI melaporkan peningkatan berbanding Grok 4.5 merentasi setiap penilaian yang disenaraikan, termasuk CursorBench, FrontierCode, APEX-Agents, dan Terminal-Bench . Ujian bebas oleh Artificial Analysis mengesahkan tuntutan dalam lingkungan margin 0.08 mata yang boleh diabaikan
.
Yang ketara, keputusan bebas terkuat Grok 4.6 adalah dalam penilaian kerja pengetahuan — ia mendahului bidang pada GDPval-AA v2 (1753 Elo), AA-Briefcase (1577), dan penanda aras undang-undang Harvey — menunjukkan model ini sangat sesuai untuk tugas pengetahuan profesional . Walau bagaimanapun, walaupun dipasarkan sebagai model pengekodan ejen, skor CursorBench v3.2 (69.9%) ketinggalan di belakang Fable 5 Max (70.5%), walaupun ia mengalahkan GPT-5.6 Sol Max (67.2%)
.
Gemini 3.7 Flash, bagi pihaknya, mencatatkan peningkatan kukuh pada penanda aras pengekodan dan ejen. Pada FrontierCode v1.1, ia mencapai 43.6% untuk penjanaan kod siap produksi, meningkat daripada 34.4% untuk 3.6 Flash dan mengatasi Claude Sonnet 5 (42.7%) dan GPT-5.6 Terra (41.3%) . Ia juga menunjukkan lonjakan besar pada DeepSWE v1.1 (49.0% kepada 65.3%) dan AutomationBench (17.0% kepada 30.4%)
.
Penambahan seni bina utama kepada Grok 4.6 ialah tahap penaakulan xhigh yang baharu, mod penaakulan intensif yang direka untuk tugas ejen dan pengekodan yang paling sukar . Model ini dioptimumkan untuk ketahanan ejen jangka panjang — ia menyelesaikan tugas dalam kira-kira separuh pusingan yang diperlukan oleh Claude Opus 5, atau kira-kira satu perempat daripada token input, pada harga yang disenaraikan
. Kelebihan kecekapan ini boleh dikatakan sebagai titik jualan paling kukuh untuk pembangun yang menjalankan sesi pengekodan berbilang jam
.
SpaceXAI mengaitkan peningkatan dalam Grok 4.6 kepada jangka masa latihan tambahan yang lebih panjang serta penambahbaikan ketara dalam supervised fine-tuning dan reinforcement learning — bukan kepada peningkatan kiraan parameter . Model ini mengekalkan asas V9 1.5 trilion parameter yang sama seperti Grok 4.5
.
Gemini 3.7 Flash, sementara itu, memperkenalkan "konfigurasi pemikiran boleh suai" untuk mengawal campuran kualiti, kos, dan kependaman, dan merupakan model Google pertama yang membolehkan pemprosesan video ejen .
Kekuatan Grok 4.6:
Kelemahan Grok 4.6:
Dua hari selepas pelancaran, pada 14 Ogos 2026, Grok 4.6 dilancarkan dalam GitHub Copilot merentasi semua permukaan pembangunan utama :
Log perubahan rasmi GitHub menggambarkannya sebagai "direka untuk pengekodan ejen dan aliran kerja berbilang langkah yang kompleks" . Integrasi pantas ini menandakan permintaan platform pembangun yang kukuh untuk model ini .
Urutan pelancaran 12–13 Ogos mendedahkan dua strategi persaingan yang berbeza:
Grok 4.6 (SpaceXAI) — $2/$6 per MTok — Komposit hadapan (AA Index 61) — Konteks 500K — Direka untuk pengekodan ejen dan kerja pengetahuan — Kelebihan kecekapan tugas berbanding Opus 5
Gemini 3.7 Flash (Google) — $0.75/$3.75 per MTok (promosi) — Prestasi tier kerja harian setanding Claude Sonnet 5 dan GPT-5.6 Terra — Tetingkap konteks 1M — Model Gemini pertama dengan pemprosesan video ejen — Menguasai Gemini Spark
Grok 4.6 bersaing pada kepintaran pada harga diskaun berbanding peringkat hadapan, manakala Gemini 3.7 Flash bersaing pada harga diskaun berbanding tier kerja harian. Keputusan Google untuk menawarkan Gemini 3.7 Flash pada separuh harga promosi pendahulunya — dan enggan memberikan tarikh keluaran untuk model Pro utamanya — menunjukkan strategi yang disengajakan untuk merebut bahagian pasaran di peringkat kerja harian .
Grok 4.6 berjaya mengembalikan SpaceXAI ke barisan hadapan, mengikat GPT-5.6 Sol pada kepintaran komposit pada kos yang jauh lebih rendah, dengan kelebihan kecekapan sebenar untuk tugas ejen. Kelemahannya — tidak mendahului mana-mana penanda aras pengekodan tunggal, ketinggalan di belakang Claude Opus 5 pada kepintaran komposit, dan mengekalkan harga manakala pesaing memotong harga — adalah nyata tetapi tidak mengurangkan pencapaian ini.
Respons Google, yang tiba hanya 24 jam kemudian, merangka semula keseluruhan perbualan harga. Pada kira-kira satu pertiga daripada kos Grok 4.6, Gemini 3.7 Flash menawarkan prestasi pengekodan dan ejen yang kukuh pada titik harga kerja harian — dan dengan tetingkap konteks 1M token sebagai bonus. Landskap persaingan kini jelas terbahagi dua: kepintaran peringkat hadapan pada harga diskaun (Grok 4.6) berbanding prestasi kerja harian pada harga yang sangat murah (Gemini 3.7 Flash).
Pembangun dan perusahaan berhadapan dengan pilihan yang tulen — bukan antara baik dan buruk, tetapi antara dua cadangan nilai yang sangat berbeza. Integrasi GitHub Copilot yang pantas untuk Grok 4.6 menunjukkan sekurang-kurangnya salah satu daripadanya telah menemui penontonnya.