En revanche, le Gemini 3.7 Flash de Google, sorti le 13 août, a été lancé à un prix d'introduction de 0,75 $ par million de tokens en entrée et 3,75 $ par million de tokens en sortie — soit la moitié du prix de son prédécesseur, le Gemini 3.6 Flash, et environ un tiers du coût de Grok 4.6 . Le prix d'introduction de Google court jusqu'au 31 décembre 2026, après quoi il doublera
.
Le contraste est frappant : Grok 4.6 rivalise directement en intelligence avec les modèles de pointe comme GPT-5.6 Sol et Claude Opus 5, tandis que Gemini 3.7 Flash se positionne comme un modèle « cheval de bataille », offrant des performances comparables à Claude Sonnet 5 et GPT-5.6 Terra à un coût bien moindre .
Grok 4.6 a obtenu 61 sur l'indice d'intelligence Artificial Analysis (AA) , une note composite issue de neuf évaluations . Ce score l'a placé à égalité avec GPT-5.6 Sol Max, un point derrière Claude Fable 5 Max (62) et deux points derrière Claude Opus 5 Max (63) — marquant la première fois qu'un modèle xAI rejoignait le groupe de tête
.
| Benchmark | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69,9% | 66,7% | 67,2% | 70,5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI a rapporté des gains par rapport à Grok 4.5 sur toutes les évaluations listées, y compris CursorBench, FrontierCode, APEX-Agents et Terminal-Bench . Les tests indépendants d'Artificial Analysis ont confirmé ces résultats à moins de 0,08 point près
.
Fait notable, les meilleurs résultats indépendants de Grok 4.6 ont été obtenus dans les évaluations de travail de connaissance — il domine le GDPval-AA v2 (1753 Elo), l'AA-Briefcase (1577) et le benchmark juridique Harvey — ce qui suggère que le modèle est particulièrement adapté aux tâches professionnelles de connaissance . Cependant, bien qu'il soit commercialisé comme un modèle de codage agentique, son score CursorBench v3.2 (69,9 %) reste inférieur à celui de Fable 5 Max (70,5 %), même s'il bat GPT-5.6 Sol Max (67,2 %)
.
Gemini 3.7 Flash, de son côté, a enregistré des progrès significatifs sur les benchmarks de codage et d'agents. Sur FrontierCode v1.1, il a obtenu 43,6 % pour la génération de code prêt pour la production, contre 34,4 % pour le 3.6 Flash, et devance Claude Sonnet 5 (42,7 %) et GPT-5.6 Terra (41,3 %) . Il montre également des bonds importants sur DeepSWE v1.1 (49,0 % à 65,3 %) et AutomationBench (17,0 % à 30,4 %)
.
La principale nouveauté architecturale de Grok 4.6 est un nouveau niveau de raisonnement xhigh , un mode de réflexion intensive conçu pour les tâches agentiques et de codage les plus complexes . Le modèle a été optimisé pour la durabilité des agents à longue durée : il résout les tâches en environ deux fois moins d'étapes que Claude Opus 5, ou environ un quart des tokens d'entrée, au prix indiqué
. Cet avantage en termes d'efficacité est sans doute son argument de vente le plus fort pour les développeurs qui réalisent des sessions de codage de plusieurs heures
.
SpaceXAI attribue les gains de Grok 4.6 à un cycle d'entraînement supplémentaire plus long et à un apprentissage supervisé et par renforcement nettement améliorés — et non à une augmentation du nombre de paramètres . Le modèle conserve la même base V9 de 1,5 billion de paramètres que Grok 4.5
.
Gemini 3.7 Flash, quant à lui, introduit des « configurations de réflexion personnalisables » pour contrôler le rapport qualité/coût/latence et est le premier modèle Google à permettre le traitement vidéo agentique .
Forces de Grok 4.6 :
Limites de Grok 4.6 :
Deux jours après le lancement, le 14 août 2026, Grok 4.6 a été déployé dans GitHub Copilot sur toutes les principales surfaces de développement :
Le journal des modifications officiel de GitHub le décrit comme « conçu pour le codage agentique et les workflows complexes en plusieurs étapes » . Cette intégration rapide témoigne d'une forte demande de la plateforme de développement pour ce modèle .
La séquence de lancement des 12 et 13 août révèle deux stratégies concurrentielles distinctes :
Grok 4.6 (SpaceXAI) — 2/6 $ par MTok — Composite de pointe (AA Index 61) — Contexte 500K — Conçu pour le codage agentique et le travail de connaissance — Efficacité des tâches supérieure à Opus 5
Gemini 3.7 Flash (Google) — 0,75/3,75 $ par MTok (prix d'introduction) — Performances de niveau « cheval de bataille » comparables à Claude Sonnet 5 et GPT-5.6 Terra — Fenêtre de contexte de 1M — Premier modèle Gemini avec traitement vidéo agentique — Alimente Gemini Spark
Grok 4.6 rivalise sur l'intelligence à prix réduit par rapport aux modèles de pointe, tandis que Gemini 3.7 Flash rivalise sur le prix à prix réduit par rapport à la catégorie « cheval de bataille ». La décision de Google de proposer Gemini 3.7 Flash à la moitié du prix d'introduction de son prédécesseur — et de refuser de fournir une date de sortie pour son modèle Pro phare — suggère une stratégie délibérée de conquête de parts de marché au niveau « cheval de bataille » .
Grok 4.6 a réussi à ramener SpaceXAI dans le peloton de tête, égalant GPT-5.6 Sol sur l'intelligence composite à un coût nettement inférieur, avec un avantage d'efficacité réel pour les tâches agentiques. Ses limites — ne pas dominer un seul benchmark de codage, être légèrement en retrait de Claude Opus 5 sur l'intelligence composite et maintenir ses prix pendant que ses concurrents les réduisaient — sont réelles mais ne diminuent pas cette performance.
La réponse de Google, arrivée seulement 24 heures plus tard, a redéfini toute la conversation sur les prix. Pour environ un tiers du coût de Grok 4.6, Gemini 3.7 Flash offrait des performances solides en codage et en agentivité à un prix de « cheval de bataille » — et avec une fenêtre de contexte d'un million de tokens, qui plus est. Le paysage concurrentiel est désormais clairement bifurqué : l'intelligence de pointe à prix réduit (Grok 4.6) contre des performances de « cheval de bataille » à prix cassé (Gemini 3.7 Flash).
Les développeurs et les entreprises sont confrontés à un véritable choix — non pas entre le bon et le mauvais, mais entre deux propositions de valeur très différentes. L'intégration rapide de Grok 4.6 dans GitHub Copilot suggère qu'au moins l'une d'entre elles a déjà trouvé son public.