Benchmarks independentes da avaliação CAISI do NIST (Instituto Nacional de Padrões e Tecnologia dos EUA) mostram o DeepSeek V4 Pro competindo diretamente com o melhor da OpenAI e Anthropic :
| Benchmark | DeepSeek V4 Pro | OpenAI GPT-5.5 | Anthropic Opus 4.6 |
|---|---|---|---|
| GPQA Diamond (raciocínio científico) | 90,1% | 96% | 91% |
| MMLU-Pro (conhecimento amplo) | 87,5% | ~92% | 89,1% |
| SWE-bench Verified (programação) | 80,6% | ~75% | ~78% |
Destaques adicionais de desempenho:
A história financeira da IA chinesa é tão dramática quanto a técnica:
Alibaba (Qwen) segue uma estratégia de ecossistema de código aberto: a maioria dos modelos é lançada sob licença Apache 2.0, são fáceis de ajustar e gratuitos para hospedar internamente . Isso fez do Qwen a família de modelos mais baixada no Hugging Face. A desvantagem é a monetização — a IA da Alibaba é um sucesso, mas difícil de transformar em uma máquina de dinheiro direta, como reportou o New York Times
. No entanto, a Alibaba começou a mudar: o carro-chefe Qwen 3.6 Max Preview foi lançado como um modelo proprietário fechado via API em abril de 2026
.
DeepSeek adota uma abordagem híbrida: ela abre os pesos do V4 sob licença MIT (Mixture-of-Experts de 1,6 trilhão de parâmetros, 49 bilhões ativos), enquanto também oferece uma camada de API barata . Sua arquitetura — MoE com ativação extremamente esparsa — permite desempenho de fronteira a um custo de inferência dramaticamente menor.
Empresas ocidentais (OpenAI, Anthropic, Google) dependem principalmente de APIs proprietárias e fechadas com preços premium. OpenAI e Anthropic lançaram camadas mais baratas ("nano" e "mini") em resposta à pressão, mas nenhuma iguala a relação preço-desempenho de nível de fronteira da DeepSeek .