No hay ganador absoluto: GPT 5.5 lidera en ARC AGI 2 con 85% y en Terminal Bench 2.0 con 82,7%, mientras Claude Opus 4.7 toma ventaja en HLE y SWE Bench Pro. Kimi K2.6 conviene leerlo como un candidato fuerte para coding y agentes: marca 54 en Artificial Analysis y 87 en el benchmark de AkitaOnRails, aunque hay meno...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: GPT-5.5 vs Claude Opus 4.7 vs Kimi K2.6 vs DeepSeek V4: кто лидирует в бенчмарках. Article summary: Единого победителя нет: GPT 5.5 ведёт в ARC AGI 2 с 85% против 75,8% у Claude и в Terminal Bench 2.0 с 82,7%, а Claude Opus 4.7 сильнее в HLE и SWE Bench Pro; вывод ограничен тем, что источники сравнивают разные режим.... Topic tags: ai, llm benchmarks, openai, anthropic, claude. Reference image context from search candidates: Reference image 1: visual subject "[Kimi K2 vs Claude Opus 4.7 vs GPT 5.5 Comparison](https://www.youtube.com/watch?v=M90iB4hpenI). . [](https://www.youtube.com" source context "Kimi K2 vs Claude Opus 4.7 vs GPT 5.5 Comparison - YouTube" Reference image 2: visual subject "[Kimi K2 vs Claude Opus 4.7 vs GPT 5.5 Comparison](https://www.youtube.
Reducir GPT-5.5, Claude Opus 4.7, Kimi K2.6 y DeepSeek V4 a un único ganador sería engañoso. Las tablas disponibles cruzan pruebas distintas, modos distintos y, en algunos casos, no incluyen a los cuatro modelos en la misma fila. Aun así, el patrón es bastante claro: GPT-5.5 sale mejor parado en ARC y tareas de agente en terminal; Claude Opus 4.7 en HLE y SWE-Bench Pro; Kimi K2.6 es un rival interesante para coding y flujos agentic con ruta open-weight; y DeepSeek V4 no suele tener el score máximo, pero cambia la conversación por precio.
El guion — indica que el fragmento de fuente disponible no ofrece un resultado comparable para ese modelo.
Los resultados no forman una liga cerrada donde todos juegan exactamente el mismo partido. Artificial Analysis compara GPT-5.5 medium, Kimi K2.6 y Claude Opus 4.7 Non-reasoning high; AkitaOnRails usa GPT-5.5 xHigh/Codex y separa DeepSeek V4 Flash de DeepSeek V4 Pro; VentureBeat distingue entre GPT-5.5 y GPT-5.5 Pro.
Incluso el duelo más directo, GPT-5.5 contra Claude Opus 4.7, depende mucho de la familia de tareas. LLM Stats indica que, en 10 benchmarks reportados por ambos proveedores, Opus 4.7 lidera en 6 y GPT-5.5 en 4; las ventajas de Claude se concentran en pruebas de razonamiento y revisión, mientras que las de GPT-5.5 se agrupan en uso prolongado de herramientas y tareas guiadas por shell.
Los indicios más fuertes a favor de GPT-5.5 están en ARC y Terminal-Bench. En ARC-AGI-2 obtiene 85% frente al 75,8% de Claude Opus 4.7; en ARC-AGI-1 marca 95% frente a 93,5%. Si tu caso de uso se parece a resolver patrones visuales, razonamiento abstracto o tareas de terminal ejecutadas por un agente, esos datos son los más relevantes de la comparación.
Terminal-Bench 2.0 refuerza esa lectura: VentureBeat recoge 82,7% para GPT-5.5, bastante por encima del 69,4% de Claude Opus 4.7 y del 67,9% de DeepSeek. Artificial Analysis también coloca a GPT-5.5 medium por encima de Kimi K2.6, con 57 frente a 54, y del modo Claude Opus 4.7 Non-reasoning high, con 52.
El matiz importa: no es un ranking universal de todos los modos posibles de cada modelo.
Claude Opus 4.7 se ve más fuerte donde pesan el razonamiento duro y la revisión de código complejo. En Humanity’s Last Exam sin herramientas, VentureBeat cita 46,9% para Claude, 41,4% para GPT-5.5 y 37,7% para DeepSeek; con herramientas, Claude marca 54,7%, GPT-5.5 llega a 52,2% y DeepSeek a 48,2%.
En SWE-Bench Pro, DataCamp da 64,3% a Claude Opus 4.7, 58,6% a GPT-5.5 y 55,4% a DeepSeek V4 Pro. Esa ventaja encaja con la lectura de LLM Stats: Claude lidera frente a GPT-5.5 en GPQA, HLE sin herramientas, HLE con herramientas, SWE-Bench Pro, MCP Atlas y FinanceAgent v1.1.
Kimi K2.6 no encaja tan bien en un ranking único porque aparece en menos cruces directos con los otros tres. En Artificial Analysis obtiene 54, por debajo de GPT-5.5 medium con 57, pero por encima de Claude Opus 4.7 Non-reasoning high con 52.
En el benchmark de coding de AkitaOnRails, Kimi K2.6 marca 87: queda por debajo de Claude Opus 4.7 con 97 y de GPT-5.5 xHigh/Codex con 96, pero por encima de DeepSeek V4 Flash con 78 y DeepSeek V4 Pro con 69. En otra comparación de Verdent sobre SWE-Bench Verified, Kimi K2.6 aparece con 80,2% frente al 87,6% de Claude Opus 4.7.
Su diferencia práctica está en la vía open-weight. Verdent indica que los pesos de K2.6 están disponibles en Hugging Face y que puede ejecutarse con vLLM, SGLang o KTransformers; también habla de una configuración mínima viable de 4× H100 para la variante INT4 con contexto reducido. El README de Hugging Face recoge para Kimi K2.6 métricas agentic como HLE-Full con herramientas 54,0, BrowseComp 83,2, DeepSearchQA f1-score 92,5, Toolathlon 50,0 y MCPMark 55,9, aunque esa tabla compara Kimi sobre todo con GPT-5.4, Claude Opus 4.6 y Gemini 3.1 Pro, no con el conjunto completo de este artículo.
En las fuentes citadas, DeepSeek V4 se parece más a una apuesta de valor que a un líder de raw score. En VentureBeat queda por debajo de GPT-5.5 y Claude Opus 4.7 en HLE sin herramientas, HLE con herramientas y Terminal-Bench 2.0. En DataCamp, DeepSeek V4 Pro obtiene 55,4% en SWE-Bench Pro frente al 58,6% de GPT-5.5 y el 64,3% de Claude.
En AkitaOnRails, DeepSeek V4 Flash marca 78 y DeepSeek V4 Pro 69, por debajo de Kimi K2.6, GPT-5.5 xHigh/Codex y Claude Opus 4.7 en esa misma tabla.
El precio, sin embargo, puede cambiar la decisión de producto. Mashable sitúa DeepSeek V4 en US$1,74 por 1 millón de tokens de entrada y US$3,48 por 1 millón de tokens de salida; GPT-5.5 aparece en US$5/US$30 y Claude Opus 4.7 en US$5/US$25. Eso no lo convierte en el ganador de los benchmarks, pero sí en un candidato lógico para borradores masivos, evaluaciones internas de bajo riesgo o pruebas donde el coste por intento pesa más que el mejor score posible.
Si la lectura es estrictamente de benchmarks, la parte alta se reparte entre GPT-5.5 y Claude Opus 4.7. GPT-5.5 sale mejor en ARC y Terminal-Bench; Claude Opus 4.7 en HLE y SWE-Bench Pro. Kimi K2.6 queda como un candidato fuerte para código y agentes, especialmente cuando importa la opción open-weight, aunque tiene menos comparaciones directas con todo el grupo.
DeepSeek V4 suele quedar por debajo en raw score, pero su precio de API lo mantiene muy relevante para pilotos centrados en coste/rendimiento.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
No hay ganador absoluto: GPT 5.5 lidera en ARC AGI 2 con 85% y en Terminal Bench 2.0 con 82,7%, mientras Claude Opus 4.7 toma ventaja en HLE y SWE Bench Pro.
No hay ganador absoluto: GPT 5.5 lidera en ARC AGI 2 con 85% y en Terminal Bench 2.0 con 82,7%, mientras Claude Opus 4.7 toma ventaja en HLE y SWE Bench Pro. Kimi K2.6 conviene leerlo como un candidato fuerte para coding y agentes: marca 54 en Artificial Analysis y 87 en el benchmark de AkitaOnRails, aunque hay menos comparaciones directas con los cuatro modelos.
DeepSeek V4 suele quedar por debajo en raw score, pero su API cuesta US$1,74 por 1 millón de tokens de entrada y US$3,48 por 1 millón de salida, frente a US$5/US$30 de GPT 5.5 y US$5/US$25 de Claude Opus 4.7.