| Variante | Parâmetros Totais | Parâmetros Ativos | Janela de Contexto | Saída Máxima |
|---|---|---|---|---|
| V4-Pro | 1,6 trilhão (MoE) | ~49B por token | 1M tokens | 384K tokens |
| V4-Flash | 284 bilhões (MoE) | ~13B por token | 1M tokens | 384K tokens |
Ambas as variantes são multimodais (texto, imagem, vídeo), suportam saída JSON e chamadas de ferramentas, e estão disponíveis via API e web .
| Variante | Entrada (fora do pico) | Saída (fora do pico) | Cache Hit |
|---|---|---|---|
| V4-Pro | US$ 0,435 | US$ 0,87 | 90% de desconto |
| V4-Flash | US$ 0,14 | US$ 0,28 | 90% de desconto |
A DeepSeek também ofereceu uma promoção de 75% de desconto no V4-Pro até o início de maio de 2026 . Para efeito de comparação, o preço de saída do GPT-5.5 é de ~US$ 30/MTok, tornando o V4-Flash aproximadamente 107 vezes mais barato .
Os resultados de benchmark do DeepSeek V4 contam uma história matizada:
Atenção importante da avaliação CAISI do NIST (maio de 2026): Os benchmarks auto-reportados pela DeepSeek afirmam paridade com GPT-5.4 e Opus 4.6, mas a avaliação independente do CAISI constatou que o V4 é "substancialmente menos capaz" em benchmarks não públicos, sugerindo que algumas pontuações auto-reportadas podem ser infladas . O Intelligence Index da Artificial Analysis classifica GPT-5.5 (alto) em 53 vs. DeepSeek V4 Pro (Raciocínio, Alto Esforço) em 41* — o GPT-5.5 é mais inteligente e mais rápido (69 vs. 56 tok/s), mas a DeepSeek é muito mais barata (US$ 0,18 vs. US$ 4,35/MTok em modo de raciocínio) .
A equipe Qwen da Alibaba apresentou o Qwen 3.8 Max na World AI Conference em Xangai, em 19 de julho de 2026 . É o primeiro modelo principal da equipe acima de 1 trilhão de parâmetros.
| Atributo | Detalhe |
|---|---|
| Parâmetros totais | 2,4 trilhões (MoE esparso) |
| Arquitetura | Mixture-of-Experts, multimodal (texto + visão confirmados) |
| Janela de contexto | 983.616 tokens por endpoint do Qwen Cloud ; repetido como ~1M em algumas fontes |
| Saída máxima | 64.000 tokens |
| Licença | Ainda não publicada; Alibaba diz que os pesos abertos virão "em breve" |
Nenhum preço pré-pago foi publicado. O acesso atualmente é por assinatura via Qwen Chat e parceiros de API selecionados. O BenchLM lista o preço do Qwen 3.8 Max Preview como "Não listado" . Alguns rastreadores terceiros mostram preços automáticos de US$ 1,50/US$ 5,00 por milhão de tokens de entrada/saída, mas isso não é confirmado pela Alibaba .
A Alibaba afirma que o Qwen 3.8 é "perdendo apenas para o Fable 5" (o principal modelo Claude da Anthropic), o que o colocaria à frente do GPT-5.5 e do DeepSeek V4 no ranking da própria Alibaba . São reivindicados ganhos em codificação, produtividade profissional, desenvolvimento full-stack, análise de dados e fluxos de trabalho de escritório em relação ao Qwen 3.7 Max .
No entanto, nenhum benchmark independente foi publicado. O BenchLM, um site de rastreamento de benchmarks, monitora 321 benchmarks para o Qwen 3.8 Max Preview com 0 resultados verificados até 20 de julho de 2026 . Como disse uma análise, "Vale a pena testar o Qwen 3.8, mas é muito cedo para tratá-lo como um substituto de produção estável para Kimi K3, GPT-5.6 Sol ou Claude Fable 5" .
Para contexto, os antecessores do Qwen estabeleceram uma base sólida: o Qwen 3.6-Max-Preview (20 de abril de 2026) era um modelo apenas de texto com 35B totais / 3B ativos e contexto de 262K, que afirmava ser o número 1 em seis benchmarks de codificação e agentes . O Qwen 3.7-Max (maio de 2026) expandiu para uma janela de contexto de 1 milhão de tokens com capacidades de agente de raciocínio . Mas nenhum era geralmente considerado de fronteira fora da codificação agêntica.
A Alibaba posiciona explicitamente o Qwen 3.8 como "perdendo apenas para o Fable 5" . Se essa afirmação se mantiver sob avaliação independente, colocaria o Qwen 3.8 à frente do GPT-5.5 e bem à frente do DeepSeek V4. Mas com zero benchmarks verificados, isso continua sendo uma afirmação de marketing, não um fato estabelecido. O Fable 5 da Anthropic parece ser o atual líder reconhecido da fronteira, de acordo com o próprio enquadramento da Alibaba .
Os preços agressivos da DeepSeek geraram uma corrida para o fundo do poço nos custos de API. O V4-Flash a US$ 0,14/M de entrada é radicalmente mais barato do que qualquer modelo de fronteira ocidental. A Alibaba ainda não definiu o preço do Qwen 3.8, mas o Qwen 3.6 já tinha um preço agressivo (~US$ 1,25/US$ 7,50 entrada/saída) .
A licença MIT de pesos abertos do DeepSeek V4 significa que o auto-hospedagem também é possível, comprimindo ainda mais as margens dos provedores de código fechado . Como uma análise apontou, o efeito prático é que "desenvolvedores agora podem acessar capacidade quase de fronteira (em tarefas de codificação) por uma fração do custo do GPT-5.5 ou Claude."