Testes independentes e divulgados pela empresa mostram o Kimi K3 operando na fronteira do que há de mais avançado.
| Métrica / Benchmark | Kimi K3 | Comparação | Fonte |
|---|---|---|---|
| Índice de Inteligência Artificial Analysis | 57 | Claude Fable 5 com 60 (3 pts à frente); supera Claude Opus 4.8 e GPT-5.5 | |
| Ranking geral (independente) | #4 de 186–189 modelos | À frente de Claude Opus 4.8 e GPT-5.5 | |
| Frontend Code Arena (Elo) | 1.679 Elo | Supera o Claude Fable 5 diretamente | |
| Benchmarks agentivos (Program Bench, SWE Marathon, SpreadsheetBench 2, Automation Bench, BrowseComp) | #1 em 4 de 8 | Único modelo aberto a liderar qualquer benchmark agentivo | |
| Avaliação interna da Moonshot | Supera outros modelos testados | Ainda fica atrás do Claude Fable 5 e GPT-5.6 Sol no geral |
Detalhe importante: A própria Moonshot reconhece que o Kimi K3 "ainda fica atrás dos modelos proprietários mais poderosos, Claude Fable 5 e GPT 5.6 Sol", mas enfatiza que é o único modelo de peso aberto operando neste nível de desempenho .
A precificação é simples, sem faixas por tamanho de contexto :
| Tipo de Token | Preço por milhão de tokens |
|---|---|
| Entrada (cache miss) | US$ 3,00 |
| Entrada (cache hit) | US$ 0,30 |
| Saída | US$ 15,00 |
Isso representa cerca de metade do custo por tarefa dos modelos americanos de fronteira de código fechado . O preço agressivo é uma peça central da estratégia competitiva do K3.
Desafios de infraestrutura:
Desafios de mercado:
O Kimi K3 é um lançamento marcante — o maior modelo de peso aberto já criado, com desempenho próximo ao dos melhores modelos fechados dos EUA, custando cerca de metade do preço por tarefa. Sua promessa de pesos abertos em 27 de julho de 2026, sob uma licença permissiva, pode acelerar ainda mais a descentralização das capacidades de IA. As principais ressalvas são os requisitos de hardware para auto-hospedagem, as restrições contínuas de exportação de chips entre EUA e China e a necessidade de verificação independente sustentada das alegações de benchmark.