También hay que separar las variantes de DeepSeek. En la tabla común aparece DeepSeek-V4-Pro-Max, mientras que otra cifra de SWE-Bench Verified corresponde a DeepSeek V4-Pro, no a Pro-Max . Dicho de forma práctica: DeepSeek V4 no es una sola cifra universal; el resultado depende de la variante y de la fuente.
| Benchmark | GPT-5.5 | GPT-5.5 Pro | Claude Opus 4.7 | DeepSeek V4 | Kimi K2.6 | Líder según los datos disponibles |
|---|---|---|---|---|---|---|
| GPQA Diamond | 93,6 % | n/d | 94,2 % | 90,1 % en DeepSeek-V4-Pro-Max | n/d | Claude Opus 4.7 |
| Humanity's Last Exam, sin herramientas | 41,4 % | 43,1 % | 46,9 % | |||
| Humanity's Last Exam, con herramientas | 52,2 % | 57,2 % | 54,7 % | |||
| Terminal-Bench 2.0 | 82,7 % | n/d | 69,4 % | 67,9 % en DeepSeek-V4-Pro-Max | ||
| SWE-Bench Pro / SWE Pro | 58,6 % | n/d | 64,3 % | 55,4 % en DeepSeek-V4-Pro-Max | ||
| BrowseComp | 84,4 % | 90,1 % | 79,3 % | |||
| MCP Atlas / MCPAtlas Public | 75,3 % | n/d | 79,1 % | 73,6 % en DeepSeek-V4-Pro-Max | ||
| SWE-Bench Verified | n/d | n/d | 87,6 % en una comparación separada | 80,6 % para DeepSeek V4-Pro, no Pro-Max | 80,2 |
En la tabla, n/d significa que el dato no aparece en la fuente correspondiente; no equivale a que el modelo haya obtenido cero.
En GPQA Diamond, la diferencia entre Claude Opus 4.7 y GPT-5.5 es pequeña: 94,2 % frente a 93,6 %. DeepSeek-V4-Pro-Max queda más atrás con 90,1 % .
La ventaja de Claude se nota más en Humanity's Last Exam sin herramientas: 46,9 %, frente al 41,4 % de GPT-5.5, el 43,1 % de GPT-5.5 Pro y el 37,7 % de DeepSeek-V4-Pro-Max .
Pero el orden cambia cuando se permiten herramientas. En esa fila de HLE, GPT-5.5 Pro alcanza 57,2 %, por delante de Claude Opus 4.7 con 54,7 %, GPT-5.5 con 52,2 % y DeepSeek-V4-Pro-Max con 48,2 % . La lectura más justa es esta: Claude parece más fuerte en razonamiento puro sin herramientas, mientras que GPT-5.5 Pro lidera en la prueba de razonamiento asistido por herramientas que aparece en la tabla .
La mayor distancia a favor de GPT-5.5 aparece en Terminal-Bench 2.0: 82,7 %, frente al 69,4 % de Claude Opus 4.7 y el 67,9 % de DeepSeek-V4-Pro-Max . Para Kimi K2.6, la ficha de Hugging Face informa 66,7 en Terminal-Bench 2.0, y el leaderboard de LLM Stats también recoge 0,667 para Kimi K2.6 y 0,694 para Claude Opus 4.7 . Eso deja a Kimi cerca de Claude y DeepSeek en esa escala concreta, pero claramente por debajo de GPT-5.5 según la tabla común .
En SWE-Bench Pro / SWE Pro, la foto cambia. Claude Opus 4.7 lidera con 64,3 %, GPT-5.5 marca 58,6 % y DeepSeek-V4-Pro-Max queda en 55,4 % . Kimi K2.6 también aparece con 58,6 en SWE-Bench Pro en su ficha de Hugging Face, pero ese dato no procede del mismo pase comparativo que la tabla principal .
SWE-Bench Verified conviene leerlo con más cautela. Para Kimi K2.6 hay un valor de 80,2 en la ficha del modelo y en el archivo de evaluación . En otra revisión de DeepSeek V4 se citan 87,6 % para Claude Opus 4.7 y 80,6 % para DeepSeek V4-Pro, pero esa fuente no ofrece una fila completa con GPT-5.5 y, además, habla de V4-Pro, no de V4-Pro-Max .
GPT-5.5 destaca sobre todo en Terminal-Bench 2.0: su 82,7 % es el mejor resultado de la tabla común en esa fila . GPT-5.5 Pro no aparece en todos los benchmarks, pero donde sí figura queda muy bien situado: 57,2 % en HLE con herramientas y 90,1 % en BrowseComp, ambos primeros puestos en esas filas .
Si la prioridad son tareas de agente en terminal, GPT-5.5 debería estar entre los primeros modelos a probar. Si el flujo depende de herramientas, navegación o acciones externas, GPT-5.5 Pro es el candidato más fuerte en las filas donde hay datos .
Claude Opus 4.7 lidera varias líneas de la tabla común: 94,2 % en GPQA Diamond, 46,9 % en HLE sin herramientas, 64,3 % en SWE-Bench Pro / SWE Pro y 79,1 % en MCP Atlas / MCPAtlas Public . En cambio, pierde frente a GPT-5.5 en Terminal-Bench 2.0 y frente a GPT-5.5 Pro en HLE con herramientas y BrowseComp .
Para razonamiento difícil sin herramientas o para tareas de programación cercanas a SWE-Bench Pro, Claude Opus 4.7 aparece como el candidato más sólido en estas métricas .
Kimi K2.6 no puede ordenarse de forma estricta contra todos los demás porque sus cifras proceden de una ficha de Hugging Face y de un archivo de evaluación aparte . Aun así, su perfil de programación es llamativo: la ficha cita 80,2 en SWE-Bench Verified, 58,6 en SWE-Bench Pro, 76,7 en SWE-Bench Multilingual, 66,7 en Terminal-Bench 2.0 y 73,1 en OSWorld-Verified .
Su atractivo operativo está en que otra fuente señala pesos disponibles en Hugging Face y ejecución mediante vLLM, SGLang o KTransformers . Eso no convierte a Kimi en ganador de la tabla general, pero sí lo vuelve interesante para equipos que quieran hacer pruebas autoalojadas o experimentos con mayor control de despliegue .
En la tabla común, DeepSeek aparece como DeepSeek-V4-Pro-Max . En las filas citadas no queda primero: obtiene 90,1 % en GPQA Diamond, 37,7 % en HLE sin herramientas, 48,2 % en HLE con herramientas, 67,9 % en Terminal-Bench 2.0, 55,4 % en SWE-Bench Pro / SWE Pro, 83,4 % en BrowseComp y 73,6 % en MCP Atlas / MCPAtlas Public .
Su punto fuerte en esta comparativa no es el liderazgo absoluto, sino el precio. Mashable y DataCamp citan para DeepSeek V4 precios de API de 1,74 dólares por 1 millón de tokens de entrada y 3,48 dólares por 1 millón de tokens de salida; como comparación, esas mismas fuentes indican 5/30 dólares para GPT-5.5 y 5/25 dólares para Claude Opus 4.7 . Si el presupuesto es la principal restricción, DeepSeek V4 merece entrar en una evaluación propia, aunque no deba presentarse como líder de benchmarks en esta tabla .
Si se miran solo las filas realmente comparables de la tabla principal, Claude Opus 4.7 gana GPQA Diamond, Humanity's Last Exam sin herramientas, SWE-Bench Pro y MCP Atlas; GPT-5.5 gana Terminal-Bench 2.0; y GPT-5.5 Pro se impone en HLE con herramientas y BrowseComp . Kimi K2.6 parece un candidato fuerte para programación y pruebas con pesos disponibles, pero no se puede clasificar con total rigor frente al resto sin un pase común . DeepSeek V4 no lidera esas filas de benchmark, aunque sus precios de API publicados lo mantienen como una opción razonable para escenarios sensibles al coste .
| 37,7 % en DeepSeek-V4-Pro-Max |
| n/d |
| Claude Opus 4.7 |
| 48,2 % en DeepSeek-V4-Pro-Max |
| n/d |
| GPT-5.5 Pro |
| 66,7 |
| GPT-5.5 |
| 58,6 |
| Claude Opus 4.7 |
| 83,4 % en DeepSeek-V4-Pro-Max |
| n/d |
| GPT-5.5 Pro |
| n/d |
| Claude Opus 4.7 |
| No hay una fila común para todos |