Por el contrario, Gemini 3.7 Flash de Google, lanzado el 13 de agosto, llegó con un precio introductorio de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, la mitad del precio de su predecesor, Gemini 3.6 Flash, y aproximadamente un tercio del costo de Grok 4.6 . El precio introductorio de Google estará vigente hasta el 31 de diciembre de 2026, después de lo cual se duplicará
.
El contraste de precios es evidente: Grok 4.6 compite directamente con modelos fronterizos como GPT-5.6 Sol y Claude Opus 5 en inteligencia, mientras que Gemini 3.7 Flash se posiciona como un modelo de "caballo de batalla", ofreciendo un rendimiento comparable a Claude Sonnet 5 y GPT-5.6 Terra a un costo significativamente menor .
Grok 4.6 obtuvo una puntuación de 61 en el Índice de Inteligencia de Artificial Analysis (AA), un compuesto de nueve evaluaciones . Eso lo empató con GPT-5.6 Sol Max, lo situó un punto por detrás de Claude Fable 5 Max (62) y dos puntos por detrás de Claude Opus 5 Max (63), marcando la primera vez que un modelo de xAI se unía al grupo de la frontera
.
| Prueba | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| Índice de Inteligencia AA | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 (Elo) | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| AA-Briefcase | 1577 | — | — | — |
SpaceXAI reportó mejoras con respecto a Grok 4.5 en todas las evaluaciones publicadas, incluyendo CursorBench, FrontierCode, APEX-Agents y Terminal-Bench . Las pruebas independientes de Artificial Analysis confirmaron estas afirmaciones con un margen insignificante de 0.08 puntos
.
Es notable que los mejores resultados independientes de Grok 4.6 se dieron en evaluaciones de trabajo de conocimiento: lideró el campo en GDPval-AA v2 (1753 Elo), AA-Briefcase (1577) y la prueba legal Harvey, lo que sugiere que el modelo es particularmente adecuado para tareas de conocimiento profesional . Sin embargo, a pesar de comercializarse como un modelo de codificación agéntica, su puntuación en CursorBench v3.2 (69.9%) fue inferior a la de Fable 5 Max (70.5%), aunque superó a GPT-5.6 Sol Max (67.2%)
.
Gemini 3.7 Flash, por su parte, mostró fuertes avances en pruebas de codificación y agentes. En FrontierCode v1.1, obtuvo un 43.6% en generación de código listo para producción, frente al 34.4% de 3.6 Flash, superando a Claude Sonnet 5 (42.7%) y GPT-5.6 Terra (41.3%) . También mostró grandes saltos en DeepSWE v1.1 (de 49.0% a 65.3%) y AutomationBench (de 17.0% a 30.4%)
.
La principal novedad arquitectónica de Grok 4.6 fue un nuevo nivel de razonamiento xhigh, un modo de razonamiento intensivo diseñado para las tareas de codificación y agéntica más complejas . El modelo se optimizó para la durabilidad de agentes de larga duración: resuelve tareas en aproximadamente la mitad de los pasos que necesita Claude Opus 5, o alrededor de una cuarta parte de los tokens de entrada, al precio indicado
. Esta ventaja de eficiencia es, posiblemente, su argumento de venta más fuerte para los desarrolladores que realizan sesiones de codificación de varias horas
.
SpaceXAI atribuyó las mejoras de Grok 4.6 a un entrenamiento complementario más largo y a un ajuste fino supervisado y aprendizaje por refuerzo significativamente mejorados, no a un aumento en el número de parámetros . El modelo mantiene la misma base V9 de 1.5 billones de parámetros que Grok 4.5
.
Gemini 3.7 Flash, por su parte, introdujo "configuraciones de pensamiento personalizables" para controlar la combinación de calidad, costo y latencia, y fue el primer modelo de Google en habilitar el procesamiento de video agéntico .
Fortalezas de Grok 4.6:
Limitaciones de Grok 4.6:
Dos días después del lanzamiento, el 14 de agosto de 2026, Grok 4.6 se implementó en GitHub Copilot en todas las principales superficies de desarrollo :
El registro de cambios oficial de GitHub lo describió como "diseñado para codificación agéntica y flujos de trabajo complejos de varios pasos" . La rápida integración señaló una fuerte demanda de los desarrolladores por el modelo .
La secuencia de lanzamientos del 12 y 13 de agosto revela dos estrategias competitivas distintas:
Grok 4.6 (SpaceXAI) — $2/$6 por MTok — Compuesto fronterizo (Índice AA 61) — Contexto 500K — Diseñado para codificación agéntica y trabajo de conocimiento — Ventaja de eficiencia en tareas sobre Opus 5
Gemini 3.7 Flash (Google) — $0.75/$3.75 por MTok (introductorio) — Rendimiento de caballo de batalla comparable a Claude Sonnet 5 y GPT-5.6 Terra — Contexto 1M — Primer modelo Gemini con procesamiento de video agéntico — Impulsa Gemini Spark
Grok 4.6 compite en inteligencia a un descuento dentro de la frontera, mientras que Gemini 3.7 Flash compite en precio a un descuento dentro del nivel de caballo de batalla. La decisión de Google de ofrecer Gemini 3.7 Flash a la mitad del precio introductorio de su predecesor, y de no proporcionar una fecha de lanzamiento para su modelo Pro insignia, sugiere una estrategia deliberada para capturar cuota de mercado en el nivel de caballo de batalla .
Grok 4.6 logró devolver a SpaceXAI al nivel fronterizo, igualando a GPT-5.6 Sol en inteligencia compuesta a un costo significativamente menor, con una ventaja real de eficiencia para tareas agénticas. Sus limitaciones (no liderar ninguna prueba de codificación individual, estar por detrás de Claude Opus 5 en inteligencia compuesta y mantener los precios mientras los rivales los reducían) son reales, pero no disminuyen el logro.
La respuesta de Google, que llegó solo 24 horas después, reformuló toda la conversación sobre los precios. A aproximadamente un tercio del costo de Grok 4.6, Gemini 3.7 Flash ofreció un sólido rendimiento de codificación y agente a un precio de caballo de batalla, y con una ventana de contexto de 1 millón de tokens. El panorama competitivo ahora está claramente bifurcado: inteligencia fronteriza a descuento (Grok 4.6) frente a rendimiento de caballo de batalla a precio de ganga (Gemini 3.7 Flash).
Los desarrolladores y las empresas se enfrentan a una elección real, no entre bueno y malo, sino entre dos propuestas de valor muy diferentes. La rápida integración de Grok 4.6 en GitHub Copilot sugiere que al menos uno de ellos ya ha encontrado su audiencia.