Esta é a história desse lançamento — o que o modelo realmente pode fazer, quanto custa e por que ele representa um momento significativo na competição contínua de IA entre EUA e China.
O Kimi K3 obteve 57,1 no índice independente Artificial Analysis Intelligence Index v4.1, colocando-o em 3º lugar globalmente, atrás do Claude Fable 5 (60) e do GPT-5.6 Sol (59) . A diferença é de aproximadamente 3 pontos — apertada para os padrões históricos, mas clara: o teste de inteligência mais amplo disponível ainda favorece os principais modelos dos EUA
. A própria Moonshot reconheceu isso, afirmando publicamente que o K3 "ainda fica atrás dos modelos proprietários mais poderosos" da Anthropic e da OpenAI no desempenho agregado geral
.
Onde o K3 se destaca é em benchmarks agentivos específicos do mundo real:
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 |
| DeepSWE | 73,0 | 70,0 | 67,5 | 59,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 |
| Automation Bench | 75,6 | — | — | — |
| SpreadsheetBench 2 | 34,8 | 34,7 | 32,4 | 31,6 |
Nestes cinco benchmarks agentivos mais o Program Bench (77,8), o K3 venceu 5 de 6 de forma categórica, superando tanto o Fable 5 quanto o GPT-5.6 Sol nesses testes específicos . Ele também superou substancialmente o Claude Opus 4.8 em todos os benchmarks publicados — um resultado significativo porque o Opus 4.8 custa US$ 5 de entrada / US$ 25 de saída por milhão de tokens, tornando-o um concorrente direto em custo
.
No Arena, a plataforma de preferência humana cega construída por pesquisadores da UC Berkeley, o K3 liderou o ranking de codificação logo após o lançamento . As avaliações de comparação de crowd do Arena mostraram o K3 em primeiro lugar no desenvolvimento web front-end com uma pontuação de 1.679, à frente do Fable 5 (1.631) e do GPT-5.6 Sol (1.618)
.
Na otimização de kernel de GPU — as técnicas que melhoram a forma como os modelos de IA interagem com o hardware — a Moonshot reportou que o K3 "superou substancialmente" o Opus 4.8, o GPT-5.6 Sol e o GPT-5.5 . Isso é comercialmente significativo porque uma melhor otimização de kernel significa menor latência e maior throughput no mesmo hardware.
O modelo usa uma arquitetura MoE esparsa com 896 especialistas, dos quais apenas 16 são ativados por token, o que o torna aproximadamente comparável ao custo de inferência do GPT-5.6 Sol, apesar de ter 2,8 trilhões de parâmetros no total . Ele também introduz o Kimi Delta Attention (KDA) e o Attention Residuals (AttnRes) — novos componentes arquitetônicos projetados para melhorar o raciocínio de contexto longo
.
Um dos aspectos mais disruptivos do Kimi K3 para o mercado é seu preço de API, que subcotiza os principais modelos dos EUA por uma margem significativa:
| Modelo | Entrada (por 1M de tokens) | Saída (por 1M de tokens) |
|---|---|---|
| Kimi K3 | US$ 3,00 | US$ 15,00 |
| GPT-5.6 Sol | US$ 5,00 | US$ 30,00 |
| Claude Fable 5 | US$ 10,00 | US$ 50,00 |
| Claude Opus 4.8 | US$ 5,00 | US$ 25,00 |
O Kimi K3 custa ~40% menos que o GPT-5.6 Sol e ~70% menos que o Claude Fable 5 nas taxas de tabela . Os três modelos formam uma escada de 3,3×: o Fable 5 custa 3,3 vezes o Kimi K3 tanto na entrada quanto na saída, com o GPT-5.6 Sol quase exatamente no meio
.
Além disso, o K3 tem uma taxa de entrada com cache hit de US$ 0,30 por milhão de tokens — 10x mais barato que sua taxa sem cache — para consultas de contexto que já foram servidas antes . Em uma base por tarefa, estima-se que o K3 custe 50-65% menos que os principais modelos dos EUA
.
O preço do K3 representa uma mudança notável para a Moonshot: agora ele é precificado como um modelo de fronteira, e não como uma opção de baixo custo . Modelos Kimi anteriores, como o K2.5 e o K2.6, custavam US$ 0,60 de entrada / US$ 2,50-4,00 de saída, tornando o K3 cerca de 3-4× mais caro que seus próprios antecessores
. No entanto, ele continua mais barato que os modelos de topo dos EUA, ao mesmo tempo que oferece desempenho comparável ou superior em tarefas agentivas específicas.
Em 19 de julho de 2026 — cerca de 48 horas após o lançamento — a Moonshot AI anunciou que estava pausando temporariamente novas assinaturas para o Kimi K3. A empresa publicou no X: "O Kimi K3 recebeu muito mais amor do que esperávamos, e nossas GPUs estão sentindo. Nas últimas 48 horas, a demanda se aproximou dos limites da nossa capacidade atual" .
A empresa disse que priorizaria a computação para os assinantes existentes enquanto adicionava capacidade o mais rápido possível, planejando reabrir vagas de assinatura em lotes . Os usuários existentes mantiveram acesso total, e os serviços empresariais/API continuaram
.
Vários veículos de notícias observaram que este incidente destaca as contínuas restrições de computação da China devido às restrições de exportação de chips dos EUA . O South China Morning Post escreveu que a situação "ressalta os desafios que os laboratórios de IA chineses enfrentam ao servir seus produtos para usuários globais"
. Os pesos completos do modelo, que permitiriam que terceiros o executassem em seu próprio hardware, não estavam previstos para 27 de julho — deixando a Moonshot como a única provedora de capacidade de inferência durante a janela de lançamento
.
A Moonshot usou a pausa para dividir sua assinatura em dois planos: Kimi Membership (para web, app e Work) e Kimi Code Membership (para fluxos de trabalho de codificação), uma reestruturação projetada para alocar melhor os recursos de computação .
O lançamento do Kimi K3 teve efeitos colaterais além dos benchmarks de IA. O Straits Times reportou diretamente que o K3 "alimentou uma debandada tecnológica", e vários veículos ligaram o lançamento a uma liquidação de ações de semicondutores e IA dos EUA . Embora números específicos sobre a direção do Índice de Semicondutores da Filadélfia ou o movimento das ações da Nvidia não pudessem ser confirmados de forma independente dentro do conjunto de fontes disponível, o contexto de mercado mais amplo da liquidação é bem documentado.
No lado corporativo, a Reuters reportou em 20 de julho de 2026 que a pausa na assinatura "ocorre enquanto a empresa busca novos financiamentos, com fontes dizendo que está se movendo em direção a uma oferta pública inicial em Hong Kong" . No entanto, nenhuma fonte dentro da evidência disponível confirmou uma resolução específica de acionistas para uma meta de avaliação de US$ 30 bilhões. O relatório da Reuters menciona um impulso para o IPO sem especificar uma avaliação alvo
.
Os pesos completos do modelo para o Kimi K3 estão programados para lançamento público em 27 de julho de 2026 . Este é um detalhe crítico porque significa que desenvolvedores e organizações podem eventualmente baixar, executar, inspecionar, ajustar e possuir o modelo, em vez de apenas alugá-lo através de uma API
. A implementação em duas etapas — primeiro a API, pesos abertos onze dias depois — é a forma de todo o anúncio
.
Antes do lançamento dos pesos abertos, os desenvolvedores podem acessar o K3 através do kimi.com, da API Kimi ou do OpenRouter . O modelo fala o SDK da OpenAI, suporta chamada de ferramentas, saída estruturada e cache de contexto automático, e tem uma janela de contexto de 1 milhão de tokens sem sobretaxa de contexto longo
.
Dito isso, executar um modelo de 2,8 trilhões de parâmetros localmente não é trivial. O tamanho do arquivo é estimado em aproximadamente 1,5 TB, e o hardware recomendado inclui 64+ GPUs NVIDIA H100 empresariais . Para a maioria das equipes, a API continuará sendo o ponto de acesso prático.
O Kimi K3 não é o modelo que destrona o GPT-5.6 Sol ou o Claude Fable 5 em inteligência geral — a própria Moonshot diz isso. Mas é o modelo que prova que um sistema de peso aberto pode competir com modelos proprietários de fronteira em tarefas específicas e comercialmente valiosas, custando uma fração do preço. É o maior modelo de peso aberto já lançado, e chegou com demanda real do mundo real suficiente para derrubar a infraestrutura de GPU de uma empresa em dois dias.
Essa combinação — desempenho de nível de fronteira em benchmarks agentivos, preços agressivos, pesos abertos e um sinal claro de demanda — torna o K3 um marco significativo no cenário de IA, independentemente de onde ele se senta em qualquer ranking individual.