A Moonshot AI sustenta que a próxima etapa da IA depende de dois recursos: capacidade do modelo antes da implantação e computação usada durante o raciocínio, as ferramentas e as ações do agente. O Kimi K3 tem 2,78 trilhões de parâmetros no total, mas ativa 104,2 bilhões por token, buscando ampliar a capacidade sem a...
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: How does Moonshot AI’s 47 page Kimi K3 technical report argue that AI progress depends on scaling both pre deployment model size and post de. Article summary: K3’s core argument is that frontier progress requires scaling two complementary resources: model capacity before deployment, and the compute spent after deployment on long reasoning, tool use, and agentic rollouts.. Topic tags: general web, llm, agents, ai, productivity. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts with fa
A principal tese do Kimi K3 é que o progresso na fronteira da IA não virá apenas de treinar modelos maiores. Será preciso escalar dois recursos complementares: a capacidade incorporada ao modelo antes de ele chegar ao público e a computação consumida depois, durante raciocínio prolongado, uso de ferramentas e execuções de agentes.
Em termos simples, a Moonshot AI quer construir um modelo grande o bastante para armazenar mais capacidades, mas eficiente o suficiente para que essas capacidades possam ser exploradas em tarefas longas. A arquitetura do K3 busca reduzir o custo dos dois lados dessa equação. 1
O K3 é descrito como um modelo multimodal nativo de Mixture-of-Experts (MoE), ou mistura de especialistas, com 2,78 trilhões de parâmetros totais. Porém, somente 104,2 bilhões de parâmetros são ativados por token. Também oferece uma janela de contexto de até 1 milhão de tokens. 1
A distinção é central para a proposta. Os 2,78 trilhões representam a capacidade total disponível; os 104,2 bilhões representam a parcela acionada a cada token. Assim, o modelo pretende ter muito mais capacidade do que um sistema menor, sem pagar, a cada passo de geração, o custo computacional de um modelo denso com 2,8 trilhões de parâmetros.
O relatório afirma extrapolação nativa para 1 milhão de tokens, e não para 100 mil. O treinamento começa com sequências de 8 mil tokens e avança depois para 64 mil tokens. 1
Segundo a Moonshot, o modelo não usa embeddings posicionais explícitos. A empresa argumenta que os mecanismos recorrentes de portas e decaimento do Kimi Delta Attention, ou KDA, já codificam informação de posição de forma suficiente para permitir essa extrapolação sem modificar RoPE, uma técnica comum de codificação posicional. 1
A dificuldade de lidar com contextos extensos é que a atenção global convencional pode exigir estruturas de memória e computação que crescem com o histórico. O KDA substitui boa parte dessa atenção por um estado recorrente de tamanho fixo. Na prática, sua proposta é evitar que o custo de decodificação e o estado por token cresçam como um cache KV completo à medida que a conversa ou a tarefa se alonga. 1
A arquitetura intercala três camadas de KDA e uma camada de Gated MLA, na proporção de 3:1. O KDA fornece processamento persistente e barato da sequência; a camada MLA preserva a capacidade de recuperação global e seletiva de informações. 1
O limite inferior imposto à taxa de decaimento do KDA não é apresentado apenas como uma escolha de modelagem. Ele evita decaimentos muito pequenos, que podem causar problemas numéricos, e permite uma implementação em blocos mais favorável a tensor cores, unidades de processamento muito usadas em GPUs para IA. 1
Já os Attention Residuals (AttnRes) buscam impedir que uma rede muito profunda e predominantemente baseada em atenção linear isole informações ao longo da profundidade. Em vez de obrigar as 93 camadas a transmitir todo conteúdo útil estritamente de uma para outra, o mecanismo permite que camadas posteriores recuperem representações comprimidas de blocos anteriores. A alegação é preservar qualidade enquanto se troca parte da atenção global, mais cara, pelo KDA. 1
O K3 usa 896 especialistas roteados, com seleção top-16: para cada token, 16 especialistas são escolhidos. Esse desenho eleva a capacidade condicional do modelo, isto é, permite que diferentes trechos de entrada sejam processados por subconjuntos especializados. 1
O método chamado Stable LatentMoE trata o balanceamento de roteamento como um problema de atribuição equilibrada e deriva um ótimo exato sob hipóteses definidas no nível do lote de dados. Na inferência, porém, o roteador usa vieses fixos de especialistas e seleção top-k convencional, sem executar esse solucionador de balanceamento. 1
Isso importa para interpretar a alegação: o resultado de “equilíbrio perfeito” vale para o problema de otimização especificado no relatório, não é uma garantia de que todo lote real de produção será perfeitamente distribuído entre especialistas.
A infraestrutura MoonEP entra na parte operacional. Uma arquitetura MoE só é econômica se os tokens conseguirem chegar aos especialistas selecionados sem que desequilíbrios de rede e comunicação entre máquinas dominem a latência. O papel do MoonEP é equilibrar essa comunicação all-to-all — entre múltiplos dispositivos — causada por demanda desigual pelos especialistas. 1
Portanto, arquitetura e sistemas não são explicações independentes para o desempenho: são partes da mesma proposta. Um MoE de 896 especialistas depende de comunicação eficiente para ser treinado e servido em escala.
A tese não termina no pré-treinamento. A Moonshot descreve uma infraestrutura de pós-treinamento com uma frota de sandboxes em máquinas virtuais leves. Ela permitiria gerar muitas trajetórias verificáveis de aprendizado por reforço em tarefas longas, além de ramificar e retomar execuções a baixo custo por meio de snapshots. 1
Essa é a base para um modelo que pode investir mais passos em tempo de inferência: planejar, navegar na web, escrever e testar código, chamar ferramentas e corrigir a própria abordagem. Em vez de depender exclusivamente de um modelo pré-treinado maior e estático, o sistema tenta transformar computação adicional no momento da tarefa em capacidade prática.
O relatório também descreve a destilação de múltiplos professores de raciocínio e de domínios específicos em um único sistema. A ideia é transferir comportamentos especializados sem a necessidade de servir nove modelos separados. 1
Se forem reproduzidos, os 91,2% no BrowseComp reforçam a tese de que o K3 é especialmente forte em agentes de busca de informação de longo prazo. Um leaderboard de terceiros listava o K3 com 91,2% em 2 de setembro de 2026. 4
Ainda assim, esse resultado é de ponta a ponta. Ele não separa a contribuição de KDA, AttnRes, roteamento MoE, ambientes de aprendizado por reforço, destilação ou computação de inferência. Um benchmark elevado mostra o desempenho do conjunto, mas não prova qual peça da pilha técnica foi decisiva.
As alegações de que o K3 custaria “metade” do GPT-5.6 Sol, ou de que ficaria exatamente quatro pontos atrás do “Claude Fable 5” em um benchmark de código por 38% do custo, não puderam ser verificadas no relatório técnico nem em uma fonte independente de alta autoridade disponível aqui.
Uma comparação citada estima aproximadamente US$ 0,94 por tarefa concluída para o K3 e US$ 1,04 para o GPT-5.6 Sol — uma diferença distante de 50%. 8 Métricas desse tipo dependem de configuração, prompts, preços vigentes, duração das tarefas e do método de contabilização. Sem um harness de avaliação e uma metodologia completa de custos, elas devem ser tratadas com cautela.
A implicação estratégica do K3 parece ser menos uma disputa simples de preço e mais uma proposta de arquitetura: modelos abertos precisariam de uma nova combinação de design de modelo e infraestrutura para ultrapassar a escala de um trilhão de parâmetros e converter contexto longo e inferência agêntica em capacidade utilizável. Mas a alegação de que modelos abertos estariam parados perto de 1 trilhão de parâmetros, em comparação com o “DeepSeek V4 Pro”, não é estabelecida pelo próprio relatório com as evidências apresentadas.
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
A Moonshot AI sustenta que a próxima etapa da IA depende de dois recursos: capacidade do modelo antes da implantação e computação usada durante o raciocínio, as ferramentas e as ações do agente.
A Moonshot AI sustenta que a próxima etapa da IA depende de dois recursos: capacidade do modelo antes da implantação e computação usada durante o raciocínio, as ferramentas e as ações do agente. O Kimi K3 tem 2,78 trilhões de parâmetros no total, mas ativa 104,2 bilhões por token, buscando ampliar a capacidade sem arcar com o custo de inferência de um modelo denso de 2,8 trilhões de parâmetros.
A arquitetura combina KDA, Gated MLA, Attention Residuals, MoE com 896 especialistas e infraestrutura de comunicação para tornar contexto longo e roteamento esparso mais viáveis.