| GPT-5.5 (Pro) | 30,00 $ | 180,00 $ | — | 1M |
| Qwen3.7-Max | 2,50 $ | 7,50 $ | 0,25 $ (90% dto.) | 1M |
| Kimi K2.6 | 0,60$–0,95 $ | 3,00$–4,00 $ | 0,10 $ | 262K |
| Gemini 3.5 Flash | 1,50 $ | 9,00 $ | 0,15 $ | 1M |
| Grok 4.3 | 1,25 $ | 2,50 $ | 0,30 $ | 1M |
| DeepSeek V4-Flash | 0,14 $ | 0,28 $ | 0,0028 $ | 1M |
| DeepSeek V4-Pro | 0,435 $ (descuento permanente) | 0,87 $ (descuento permanente) | 0,0036 $ | 1M |
Claves de los precios:
Los benchmarks solo son útiles con contexto. Hemos organizado los resultados según lo que realmente miden —inteligencia general, capacidad de programación y rendimiento agéntico— en lugar de una única y a menudo engañosa puntuación compuesta.
Esta categoría mide el conocimiento puro, las matemáticas y el razonamiento científico.
| Benchmark | Claude Opus 4.8 | GPT-5.5 | DeepSeek V4-Pro | Qwen3.7-Max | Grok 4.3 | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|
| Índice de Inteligencia AA | 61.4 | 60.2 | ~55 | 56.6 | 53 | ~52 |
| GPQA Diamond | 93.6% | — | 90.1% | 92.4% | ||
| AIME / USAMO 2026 (Matemáticas) | 96.7% | 95.2% | ||||
| HLE (con herramientas) | 57.9% | — | 37.7% | — | — | — |
Claude Opus 4.8 ha abierto una brecha pequeña pero significativa sobre GPT-5.5 en inteligencia general, respaldada por una enorme mejora de 27.4 puntos en rendimiento matemático en comparación con su predecesor . Qwen3.7-Max destaca como el mejor modelo chino, casi igualando a los líderes en razonamiento científico de nivel de posgrado (GPQA Diamond) .
Los puntos de referencia más relevantes para desarrolladores.
| Benchmark | DeepSeek V4-Pro | Kimi K2.6 | GPT-5.5 | Claude Opus 4.8 | Qwen3.7-Max |
|---|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 80.2% | 88.7% | 88.6% | 72.5% |
| SWE-bench Pro | ~58% | 58.6% | 58.6% | 69.2% | |
| LiveCodeBench v6 | 93.5% | 89.6% |
El rendimiento en programación crea una clara segmentación. Claude Opus 4.8 y GPT-5.5 están empatados en la cima para la corrección general de errores (SWE-bench Verified), pero Claude toma una ventaja de más de 10 puntos en el conjunto Pro, mucho más difícil . Para una eficiencia pura de codificación por dólar, DeepSeek V4-Pro es incomparable, ofreciendo un rendimiento de codificación de clase GPT-5.4 con un descuento del 30x .
La capacidad de un modelo para actuar de forma independiente en un entorno real.
| Benchmark | GPT-5.5 | Gemini 3.5 Flash | Claude Opus 4.8 | Qwen3.7-Max | Grok 4.3 |
|---|---|---|---|---|---|
| GDPval-AA Elo | 1769 | 1656 | 1890 | — | 1500 |
| Terminal-Bench 2.0/2.1 | 82.7% | 76.2% | |||
| τ²-Bench (Seguimiento de instrucciones) | — | — | — | — | 98% |
GPT-5.5 mantiene su corona como el modelo más fuerte para el trabajo agéntico en terminal abierta, pero la calificación superior de Claude Opus 4.8 en tareas del mundo real (GDPval-AA Elo) sugiere un socio agéntico más fiable y preparado para los negocios . Grok 4.3 ofrece una opción económica convincente para tareas de seguimiento de instrucciones de gran volumen .
Por primera vez, los modelos chinos no solo compiten en precio sino en capacidad. Qwen3.7-Max lidera todos los modelos en el benchmark de codificación agéntica SWE-bench Pro con un 60.6% . Kimi K2.6 iguala el rendimiento de GPT-5.5 en esa misma prueba y lidera a todos los demás modelos en el "Último Examen de la Humanidad" (HLE) con herramientas con un 54.0% , desafiando a los líderes americanos en tareas de razonamiento básico a la vez que reducen drásticamente sus precios.
Una comparación directa y completa entre los siete modelos es actualmente imposible debido a la publicación selectiva de puntos de referencia por parte de los proveedores . Varios factores clave socavan una elección puramente basada en números:
Tu prioridad debe dictar tu elección:
Para cualquier implementación crítica, ejecuta pruebas en tu propia carga de trabajo específica. Los puntos de referencia comunicados por los proveedores son un punto de partida útil, no una respuesta definitiva.
| — |
| 92.6% |
| — |
| — |
| — |
| — |
| 60.6% |
| — |
| — |
| — |
| 74.6% |
| 69.7% |
| — |