Kimi K3 plantea que el progreso en IA depende de dos recursos complementarios: la capacidad del modelo antes del despliegue y el cómputo utilizado durante la inferencia. El modelo cuenta con 2,78 billones de parámetros totales, pero activa 104,2 mil millones por token, evitando el coste de inferencia de un modelo de...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
La tesis central de Kimi K3 es que el avance en la frontera de la IA requiere escalar dos recursos complementarios: la capacidad del modelo antes de su despliegue y el cómputo consumido después, durante inferencias largas con razonamiento, herramientas y ejecuciones agentivas. Su arquitectura busca que ambas cosas sean económicamente viables: un modelo MoE de unos 2,8 billones de parámetros puede almacenar más capacidades, mientras activa cerca de 104.000 millones de parámetros por token; además, su pila de atención, enrutamiento, comunicaciones y aprendizaje por refuerzo pretende reducir el coste de aprovechar esa capacidad. 1
K3 se describe como un modelo multimodal nativo de tipo Mixture of Experts (MoE), con 2,78 billones de parámetros totales y 104,2 mil millones activados por token. También admite una ventana de contexto de hasta un millón de tokens. 1
La distinción es decisiva: los 2,78 billones representan la capacidad total almacenada en el modelo, mientras que los 104,2 mil millones son la parte que se activa para procesar cada token. Así, Moonshot intenta escalar la capacidad sin asumir, en cada paso de inferencia, el coste de un modelo denso de 2,8 billones de parámetros. 1
El informe afirma extrapolación nativa hasta un millón de tokens, no 100.000. El entrenamiento comienza con secuencias de 8.000 tokens y posteriormente pasa a 64.000. K3 no usa incrustaciones posicionales explícitas: Moonshot sostiene que las compuertas recurrentes y la desintegración temporal de KDA codifican suficientemente la posición como para permitir esa extrapolación sin modificar RoPE. 1
Kimi Delta Attention (KDA) sustituye buena parte de la atención cuadrática por un estado recurrente de tamaño fijo. Por ello, el estado por token y el coste de decodificación no crecen con el contexto previo de la misma forma que una caché KV completa.
Moonshot intercala tres capas KDA por cada capa Gated MLA. En este esquema, KDA aporta procesamiento persistente y barato de secuencias, mientras que MLA recupera selectivamente información global. 1
El límite inferior aplicado a la tasa de desintegración de KDA no es solo un ajuste de modelado. Según el informe, evita valores de desintegración extremadamente pequeños que resultan problemáticos desde el punto de vista numérico y permite un cálculo por bloques más adecuado para tensor cores. 1
A ello se suman los Attention Residuals o AttnRes. Su objetivo es evitar que una red muy profunda y dominada por atención lineal aísle información entre capas. Las capas posteriores pueden recuperar representaciones comprimidas procedentes de bloques de profundidad anteriores, en vez de depender exclusivamente de una transmisión estrictamente capa a capa. En una red de 93 capas, esta ruta transversal busca preservar calidad mientras se reemplaza gran parte de la atención global más costosa por KDA. 1
La arquitectura Stable LatentMoE usa 896 expertos y un enrutamiento top-16, es decir, selecciona 16 expertos para cada token. Esto amplía la capacidad condicional del sistema. Su método de equilibrado por cuantiles formula el enrutamiento como un problema de asignación balanceada y deriva un óptimo exacto bajo sus supuestos de lote. En despliegue, no ejecuta ese solucionador: utiliza sesgos fijos por experto y la selección top-k convencional. 1
Es una propuesta más ambiciosa que el equilibrado mediante pérdidas auxiliares, aunque el supuesto de “equilibrio perfecto” debe entenderse dentro de la optimización de enrutamiento planteada, no como una garantía de que cada lote real de producción se repartirá perfectamente.
También importa la capa operativa. Un MoE grande solo resulta eficiente si los tokens enrutados pueden llegar a sus expertos seleccionados sin que las diferencias de carga en la red disparen la latencia. MoonEP está diseñado para equilibrar la comunicación all-to-all que provoca una demanda desigual de expertos, permitiendo entrenar y servir el diseño de 896 expertos a gran escala. 1
En otras palabras, las innovaciones de arquitectura y de sistemas son complementarias: no son explicaciones independientes de una eventual mejora en los benchmarks.
La otra mitad de la propuesta no es simplemente construir un modelo más grande. Moonshot sostiene que debe ser posible dedicar más pasos de cómputo en tiempo de prueba a planificación, navegación web, programación, llamadas a herramientas y autocorrección.
Para entrenar esas conductas, el informe describe una flota de entornos aislados basada en máquinas virtuales ligeras. Esta infraestructura permite generar muchas trayectorias verificables de aprendizaje por refuerzo de larga duración, así como bifurcarlas o reanudarlas mediante instantáneas a bajo coste. 1
La idea es proporcionar el sustrato de entrenamiento para modelos que aprovechen más pasos en inferencia, en vez de depender únicamente de un modelo preentrenado más grande pero estático. El informe también describe la destilación de varios modelos docentes especializados en razonamiento y dominios concretos hacia un único sistema, con el fin de transferir esas conductas sin tener que servir nueve modelos diferentes. 1
Un 91,2 % en BrowseComp respaldaría la idea de que K3 destaca en tareas agentivas de búsqueda de información de largo recorrido. Un ranking de terceros situaba a Kimi K3 en 91,2 %, por detrás de GPT-5.6 Sol, con 92,2 %, y por delante de Claude Opus 5, con 90,8 %, a 2 de septiembre de 2026. 4
Pero un resultado de benchmark es una medición de extremo a extremo. No permite aislar cuánto aporta cada elemento —KDA, AttnRes, el enrutamiento MoE, los entornos de RL, la destilación o el cómputo adicional en inferencia— de manera individual.
No se pudo verificar en el informe técnico ni en una fuente independiente de alta autoridad la afirmación precisa de que K3 cuesta “la mitad” que GPT-5.6 Sol, ni la de que queda exactamente cuatro puntos por detrás de “Claude Fable 5” en Kimi Code Bench a un 38 % del coste.
Una comparación citada estima un coste por tarea completada de unos 0,94 dólares para K3 y 1,04 dólares para GPT-5.6 Sol, una diferencia muy alejada del 50 %. 8 Estas cifras dependen de la configuración, los prompts, los precios vigentes y el método de evaluación, por lo que deben tratarse con cautela hasta que se publique un arnés de evaluación y una contabilidad de costes completos.
La implicación estratégica del informe es más arquitectónica que comercial: Moonshot argumenta que los modelos abiertos necesitan una nueva combinación de diseño de modelo e infraestructura para superar la barrera del billón de parámetros y convertir los contextos largos y la inferencia agentiva en capacidades utilizables. Sin embargo, el propio trabajo no demuestra, con la evidencia disponible, afirmaciones más amplias sobre un supuesto estancamiento de los modelos abiertos cerca de un billón de parámetros o comparaciones con “DeepSeek V4 Pro”.
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Kimi K3 plantea que el progreso en IA depende de dos recursos complementarios: la capacidad del modelo antes del despliegue y el cómputo utilizado durante la inferencia.
Kimi K3 plantea que el progreso en IA depende de dos recursos complementarios: la capacidad del modelo antes del despliegue y el cómputo utilizado durante la inferencia. El modelo cuenta con 2,78 billones de parámetros totales, pero activa 104,2 mil millones por token, evitando el coste de inferencia de un modelo denso de ese tamaño.
Moonshot combina atención híbrida, enrutamiento MoE, comunicación entre expertos e infraestructura de aprendizaje por refuerzo para abaratar contextos largos y tareas agentivas.