Kimi K3 separa la capacidad total del coste por token: su arquitectura MoE reúne 2,8 billones de parámetros, pero activa unos 104.000 millones para cada token. El sistema híbrido KDA y Gated MLA busca hacer viable el contexto de hasta un millón de tokens, mientras AttnRes, el enrutamiento MoE y MoonEP abordan el flu...
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47-page Kimi K3 technical report argue that AI progress depends on scaling both pre-deployment model size and post-de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts. Its a. Topic tags: general, academic, general web, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, char
Moonshot AI presenta Kimi K3 como una apuesta por el escalado en dos ejes: construir un modelo mucho mayor antes de desplegarlo y, una vez en uso, darle suficiente cómputo para razonar, utilizar herramientas, navegar, programar y corregir errores. El desafío central es económico: un modelo no puede limitarse a ganar densidad y profundidad si servir contextos largos vuelve esas capacidades inviables en la práctica. El diseño de K3 busca ampliar la capacidad total sin disparar el cómputo ni la memoria requeridos por cada token generado. 1
Kimi K3 se describe como un modelo multimodal nativo de mezcla de expertos, o MoE por sus siglas en inglés, con 2,8 billones de parámetros totales, cerca de 104.000 millones de parámetros activados por token y una ventana de contexto de hasta un millón de tokens. 1
17
Estas cifras responden a preguntas distintas:
Ese es el atractivo práctico de MoE: K3 puede ser mucho mayor en conjunto que un modelo denso con una huella de cómputo por token comparable. No implica que servirlo sea barato —104.000 millones de parámetros activos siguen siendo una cifra considerable—, pero evita pagar en cada token el coste de inferencia de una red densa de 2,8 billones de parámetros. 1
Por tanto, el argumento de Moonshot no es simplemente que «más parámetros son mejores». Su tesis es que el cómputo condicional puede hacer utilizable una nueva escala de capacidad para tareas prolongadas.
Una ventana de un millón de tokens es difícil no solo de entrenar: la atención convencional puede acumular costes elevados de memoria y cómputo conforme crece la secuencia. K3 emplea un diseño híbrido que combina Kimi Delta Attention (KDA) con Gated Multi-head Latent Attention (Gated MLA). La composición reportada incluye 69 capas KDA y 24 capas Gated MLA, organizadas principalmente con un patrón de tres capas KDA por cada capa MLA. 1
12
KDA es el componente de atención lineal del modelo. En lugar de mantener en todas esas capas una caché convencional de claves y valores que crece con todo el historial, utiliza un estado recurrente de tamaño fijo. El beneficio buscado es que la memoria y el trabajo de decodificación no crezcan con el contexto previo del mismo modo que en la atención completa. 1
El informe también fija un límite inferior para la tasa de decaimiento de KDA. No es solo una preferencia de modelado: evita valores de decaimiento extremadamente pequeños, problemáticos para el cálculo numérico eficiente, y permite una implementación por bloques adaptada a la ejecución en núcleos tensoriales. 1
La recurrencia lineal, por sí sola, puede no ofrecer la misma capacidad de búsqueda selectiva global que la atención sobre un contexto completo. Por eso K3 conserva capas Gated MLA a lo largo de la red. En este híbrido, KDA aporta procesamiento persistente de bajo coste y MLA habilita recuperaciones globales periódicas. 1
La idea es relevante porque trata el contexto largo como un problema de sistemas además de arquitectura. Una ventana de contexto amplia solo es útil si el modelo todavía puede encontrar la información pertinente y responder a un coste operativo razonable.
El segundo componente arquitectónico es Attention Residuals (AttnRes). El modelo tiene 93 capas y el informe usa AttnRes para que las capas posteriores puedan recuperar representaciones comprimidas de bloques anteriores de profundidad, en lugar de obligar a que toda la información avance estrictamente de una capa a la siguiente. 1
En términos conceptuales, KDA aborda el flujo de información a lo largo de la secuencia, mientras que AttnRes lo aborda a lo largo de la profundidad de la red. Esa combinación importa en un modelo profundo donde buena parte de la pila usa atención lineal: sustituir atención global costosa solo ayuda si la información útil no se pierde o queda aislada al atravesar las activaciones. 1
La capa MoE de K3 utiliza, según el informe, 896 expertos enrutados y selecciona 16 expertos por token. 1
6 Este es el mecanismo que explica la distancia entre sus parámetros totales y los parámetros activos.
El enfoque denominado Stable LatentMoE se centra en mantener estable y equilibrado ese enrutamiento. Plantea la asignación de expertos a nivel de lote como un problema de optimización e introduce un balanceo basado en cuantiles. El informe deriva un óptimo exacto bajo sus supuestos; en el despliegue, sin embargo, el enrutamiento usa sesgos fijos de expertos y selección top-k convencional, sin resolver de nuevo el problema de balanceo para cada lote de inferencia. 1
La diferencia es importante: el equilibrio óptimo reclamado es un resultado de la formulación de enrutamiento del informe, no una garantía de que toda carga de trabajo real distribuya perfectamente los tokens entre expertos.
Los grandes modelos MoE introducen un problema de red: los tokens seleccionados a menudo deben viajar entre dispositivos para llegar a los expertos asignados. Si algunos expertos reciben una demanda desproporcionada, la ruta de comunicación más lenta puede determinar la latencia.
Moonshot sitúa MoonEP como la capa de sistemas complementaria para la comunicación paralela entre expertos. Su función es reducir el desequilibrio en los intercambios de tipo todos-con-todos que crea el enrutamiento disperso, con el objetivo de que el gran conjunto de expertos sea entrenable y servible. 1
Es una pieza clave de la afirmación de K3: arquitectura, enrutamiento y comunicación no pueden evaluarse como explicaciones independientes del rendimiento. El modelo necesita las tres para convertir capacidad dispersa teórica en rendimiento efectivo.
La otra mitad de la tesis de K3 ocurre después del preentrenamiento. Moonshot describe infraestructura para trayectorias de aprendizaje por refuerzo en tareas de larga duración que involucran herramientas, programación, navegación web y resolución iterativa de problemas. El informe también describe la destilación de varios docentes especializados en dominios y razonamiento en un único sistema. 1
El entorno de apoyo consiste en un sistema de entornos aislados mediante máquinas virtuales ligeras, diseñado para crear, capturar y reanudar tareas a gran escala. Las cifras reportadas incluyen 51,2 millones de instancias de sandbox, 133 ms para instantáneas y 49 ms para restauraciones. 1
El propósito estratégico es directo: si se espera que un modelo dedique más cómputo en tiempo de uso a planificar, llamar herramientas, comprobar su trabajo o continuar una tarea larga, el entrenamiento debe exponerlo a ese tipo de trayectorias. Poder pausar, ramificar y restaurar entornos a bajo coste permite generar más episodios de entrenamiento de ese tipo.
Esto no significa que una respuesta individual disponga automáticamente de cómputo de inferencia ilimitado. La propuesta de K3 es, más bien, construir un sistema capaz de transformar pasos adicionales y más contexto en mejor desempeño, en vez de depender exclusivamente de un modelo preentrenado más grande.
Kimi K3 registra 91,2 % en BrowseComp, un benchmark orientado a la búsqueda de información de larga duración. Un ranking de terceros también lo lista con 91,2 %, aunque las clasificaciones y configuraciones de reporte pueden variar con el tiempo. 18
El dato es coherente con el objetivo del producto: un modelo diseñado para contexto largo, posentrenamiento agéntico y razonamiento en tiempo de inferencia debe evaluarse en tareas complejas de búsqueda de información. Pero no constituye una ablación limpia de los componentes individuales.
Una sola puntuación no permite determinar qué parte del resultado corresponde a KDA, AttnRes, el enrutamiento de expertos, la infraestructura de comunicación, los entornos de aprendizaje por refuerzo, la destilación, los prompts o los ajustes de inferencia. La interpretación más sólida es que el sistema reportado rinde bien como una pila integrada, no que una innovación arquitectónica aislada explique por sí sola la puntuación. 1
18
K3 suele presentarse como un desafío para otros grandes modelos abiertos, incluidos sistemas de DeepSeek. La conclusión que permiten sostener el informe y sus especificaciones no es una tabla definitiva sobre el progreso de los modelos abiertos, sino un énfasis de diseño diferente: Moonshot defiende una pila que combina una capacidad dispersa muy grande, procesamiento eficiente de contexto largo e infraestructura de posentrenamiento para agentes. 1
17
El documento respalda las especificaciones y decisiones de diseño de K3. Por sí solo no demuestra que otros modelos abiertos estén estancados ni aísla una ventaja arquitectónica decisiva frente a un competidor concreto. Esas son afirmaciones de mercado más amplias, que exigirían comparaciones consistentes e independientes.
Las comparaciones de precio por token y coste por tarea son especialmente fáciles de sobredimensionar. Pueden cambiar según el prompt, el esfuerzo de razonamiento, la longitud del contexto, el uso de caché, las herramientas, las hipótesis de rendimiento, la fecha de precios y el entorno de evaluación.
Una comparación publicada en el material disponible estima un coste por tarea completada de aproximadamente 0,94 dólares para K3 y 1,04 dólares para GPT-5.6 Sol. Puede apuntar a una ventaja modesta en esa configuración concreta, pero no justifica una afirmación general de que K3 cuesta la mitad que Sol. 20
La conclusión útil es menos llamativa y más duradera: K3 intenta hacer económicamente creíbles el contexto largo y las capacidades agénticas a una escala total de modelo mucho mayor. Que logre esa ventaja en la práctica dependerá de evaluaciones reproducibles y de cuentas de coste específicas para cada despliegue.
El informe técnico de Kimi K3 formula un argumento de escalado de pila completa. El escalado previo al despliegue llega mediante un MoE de 2,8 billones de parámetros, con unos 104.000 millones activados por token. El escalado posterior al despliegue proviene de entrenar y servir un modelo que pueda aprovechar contexto largo, herramientas, pasos de razonamiento y trayectorias agénticas. 1
17
KDA, Gated MLA, AttnRes, Stable LatentMoE, MoonEP y la infraestructura de sandboxes para aprendizaje por refuerzo forman parte de una misma propuesta: un comportamiento agéntico de nivel frontera no requiere solo un modelo mayor, sino una arquitectura que vuelva aprovechables más contexto y más trabajo en inferencia. Los resultados de benchmark son evidencia prometedora de ese enfoque integrado, pero deben leerse como resultados reportados del sistema completo, no como una prueba definitiva de la contribución de cada componente. 1
18
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Kimi K3 separa la capacidad total del coste por token: su arquitectura MoE reúne 2,8 billones de parámetros, pero activa unos 104.000 millones para cada token.
Kimi K3 separa la capacidad total del coste por token: su arquitectura MoE reúne 2,8 billones de parámetros, pero activa unos 104.000 millones para cada token. El sistema híbrido KDA y Gated MLA busca hacer viable el contexto de hasta un millón de tokens, mientras AttnRes, el enrutamiento MoE y MoonEP abordan el flujo de información y la ejecución distribuida.
El 91,2 % reportado en BrowseComp es una señal favorable para el sistema completo, no una prueba aislada de cada componente.