Esta es la historia de ese lanzamiento: qué puede hacer realmente el modelo, cuánto cuesta y por qué representa un momento crucial en la competición de IA entre Estados Unidos y China.
Kimi K3 obtuvo una puntuación de 57.1 en el índice independiente Artificial Analysis Intelligence Index v4.1, lo que lo sitúa en el 3.er lugar mundial, detrás de Claude Fable 5 (60) y GPT-5.6 Sol (59) . La diferencia es de aproximadamente 3 puntos — ajustada para los estándares históricos, pero clara: la prueba de inteligencia más amplia disponible sigue favoreciendo a los modelos estadounidenses de primer nivel
. La propia Moonshot lo reconoció, declarando públicamente que K3 "todavía va por detrás de los modelos propietarios más potentes" de Anthropic y OpenAI en el rendimiento agregado general
.
Donde K3 realmente brilla es en benchmarks de agentes específicos y de aplicación real:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 |
| DeepSWE | 73.0 | 70.0 | 67.5 | 59.0 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 |
| Automation Bench | 75.6 | — | — | — |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 |
En estos cinco benchmarks de agentes, más Program Bench (77.8), K3 ganó 5 de 6 de forma clara, superando tanto a Fable 5 como a GPT-5.6 Sol en esas pruebas específicas . También superó sustancialmente a Claude Opus 4.8 en todos los benchmarks publicados — un resultado significativo porque Opus 4.8 tiene un precio de 5 $ de entrada y 25 $ de salida por millón de tokens, lo que lo convierte en un competidor directo en costes
.
En el Arena, la plataforma de preferencia humana ciega creada por investigadores de la Universidad de California en Berkeley, K3 encabezó la clasificación de codificación poco después de su lanzamiento . Las evaluaciones de comparación de la multitud de Arena mostraron a K3 en primer lugar en desarrollo web front-end con una puntuación de 1.679, por delante de Fable 5 (1.631) y GPT-5.6 Sol (1.618)
.
En cuanto a la optimización del kernel de GPU — las técnicas que mejoran la interacción de los modelos de IA con el hardware — Moonshot informó que K3 "superó sustancialmente" a Opus 4.8, GPT-5.6 Sol y GPT-5.5 . Esto es comercialmente significativo porque una mejor optimización del kernel se traduce en una menor latencia y un mayor rendimiento en el mismo hardware.
El modelo utiliza una arquitectura MoE dispersa con 896 expertos, de los cuales solo se activan 16 por token, lo que hace que su coste de inferencia sea aproximadamente comparable al de GPT-5.6 Sol, a pesar de tener 2,8 billones de parámetros en total . También introduce Kimi Delta Attention (KDA) y Attention Residuals (AttnRes) — nuevos componentes arquitectónicos diseñados para mejorar el razonamiento en contextos largos
.
Uno de los aspectos más disruptivos de Kimi K3 para el mercado son sus precios de API, que subcotizan a los mejores modelos estadounidenses por un margen significativo:
| Modelo | Entrada (por 1M de tokens) | Salida (por 1M de tokens) |
|---|---|---|
| Kimi K3 | 3,00 $ | 15,00 $ |
| GPT-5.6 Sol | 5,00 $ | 30,00 $ |
| Claude Fable 5 | 10,00 $ | 50,00 $ |
| Claude Opus 4.8 | 5,00 $ | 25,00 $ |
Kimi K3 cuesta ~40% menos que GPT-5.6 Sol y ~70% menos que Claude Fable 5 a tarifas de lista . Los tres modelos se sitúan en una escalera de 3,3×: Fable 5 cuesta 3,3 veces más que Kimi K3 tanto en entrada como en salida, con GPT-5.6 Sol casi exactamente en el medio
.
Además, K3 tiene una tarifa de entrada con acierto de caché de 0,30 $ por millón de tokens — 10 veces más barata que su tarifa sin caché — para consultas de contexto que ya se han servido antes . Por tarea, se estima que K3 cuesta entre un 50% y un 65% menos que los modelos insignia de EE. UU.
.
La fijación de precios de Moonshot para K3 representa un cambio notable: por primera vez, tiene el precio de un modelo de frontera, no de una opción económica . Los modelos Kimi anteriores, como K2.5 y K2.6, tenían un precio de 0,60 $ para la entrada y 2,50-4,00 $ para la salida, por lo que K3 es aproximadamente 3 o 4 veces más caro que sus propios predecesores
. Sin embargo, sigue siendo más barato que los modelos estadounidenses de primer nivel, al tiempo que ofrece un rendimiento comparable o superior en tareas de agente específicas.
El 19 de julio de 2026 — aproximadamente 48 horas después del lanzamiento — Moonshot AI anunció que suspendía temporalmente las nuevas suscripciones a Kimi K3. La compañía publicó en X: "Kimi K3 ha recibido mucho más cariño del que esperábamos, y nuestras GPUs lo están notando. En las últimas 48 horas, la demanda ha estado cerca de los límites de nuestra capacidad actual" .
La compañía dijo que priorizaría la computación para los suscriptores existentes mientras añadía capacidad lo más rápido posible, planeando reabrir las plazas de suscripción por lotes . Los usuarios existentes mantuvieron el acceso completo, y los servicios empresariales y de API continuaron
.
Múltiples medios de comunicación señalaron que este incidente pone de relieve las limitaciones de computación a las que se enfrenta China debido a las restricciones a la exportación de chips de EE. UU. . El South China Morning Post escribió que la situación "subraya los retos a los que se enfrentan los laboratorios de IA chinos para ofrecer sus productos a los usuarios globales"
. Los pesos completos del modelo, que permitirían a terceros ejecutarlo en su propio hardware, no estaban programados hasta el 27 de julio, lo que dejaba a Moonshot como el único proveedor de capacidad de inferencia durante la ventana de lanzamiento
.
Moonshot aprovechó la pausa para dividir su membresía en dos planes: Kimi Membership (para web, app y Work) y Kimi Code Membership (para flujos de trabajo de codificación), una reestructuración diseñada para asignar mejor los recursos de computación .
El lanzamiento de Kimi K3 tuvo efectos dominó más allá de los benchmarks de IA. El Straits Times informó directamente de que K3 "avivó una ola de ventas tecnológicas", y múltiples fuentes vincularon el lanzamiento con una liquidación de acciones estadounidenses de semiconductores e IA . Aunque no se pudieron confirmar de forma independiente cifras específicas sobre la dirección del Índice de Semiconductores de Filadelfia o el movimiento de las acciones de Nvidia dentro del conjunto de fuentes disponible, el contexto de mercado más amplio de esta liquidación está bien documentado.
En el ámbito corporativo, Reuters informó el 20 de julio de 2026 que la pausa en las suscripciones "se produce mientras la empresa busca nueva financiación, con fuentes que indican que se está moviendo hacia una oferta pública inicial en Hong Kong" . Sin embargo, ninguna fuente dentro de la evidencia disponible confirmó una resolución específica de los accionistas para un objetivo de valoración de 30.000 millones de dólares. El informe de Reuters menciona un impulso para la OPV sin especificar una valoración objetivo
.
Los pesos completos del modelo Kimi K3 están programados para su publicación pública el 27 de julio de 2026 . Este es un detalle crítico porque significa que los desarrolladores y las organizaciones podrán finalmente descargar, ejecutar, inspeccionar, ajustar y poseer el modelo, en lugar de solo alquilarlo a través de una API
. El lanzamiento en dos pasos —primero la API, luego los pesos abiertos once días después— es la forma de todo el anuncio
.
Antes de la publicación de los pesos abiertos, los desarrolladores pueden acceder a K3 a través de kimi.com, la API de Kimi u OpenRouter . El modelo habla el SDK de OpenAI, es compatible con la llamada a herramientas, la salida estructurada y el almacenamiento en caché automático de contexto, y tiene una ventana de contexto de 1 millón de tokens sin recargo por contexto largo
.
Dicho esto, ejecutar un modelo de 2,8 billones de parámetros a nivel local no es trivial. El tamaño del archivo se estima en aproximadamente 1,5 TB, y el hardware recomendado incluye 64 o más GPUs empresariales NVIDIA H100 . Para la mayoría de los equipos, la API seguirá siendo el punto de acceso práctico.
Kimi K3 no es el modelo que destrona a GPT-5.6 Sol o Claude Fable 5 en inteligencia general — la propia Moonshot lo dice. Pero es el modelo que demuestra que un sistema de pesos abiertos puede competir con los modelos propietarios de frontera en tareas específicas y comercialmente valiosas, a la vez que cuesta una fracción del precio. Es el modelo de pesos abiertos más grande jamás lanzado, y llegó con suficiente demanda del mundo real como para colapsar la infraestructura de GPU de una empresa en dos días.
Esa combinación —rendimiento de nivel fronterizo en benchmarks de agentes, precios agresivos, pesos abiertos y una señal clara de demanda— convierte a K3 en un hito significativo en el panorama de la IA, independientemente de dónde se sitúe en cualquier clasificación individual.