gpt-5.5 e gpt-5.5-2026-04-23 na documentação da API e afirma que GPT-5.5 e GPT-5.5 Pro ficaram disponíveis na API após uma atualização de 24 de abril de 2026, mas os trechos revisados não bastam para ranquear o modelo em todas as dimensões Um ranking único seria enganoso. As fontes não entregam uma planilha completa e comparável. O resumo acessível da Vellum lista áreas de benchmark do Claude Opus 4.7, como código, capacidades agentivas, finanças, raciocínio, multimodalidade, busca e segurança, mas não traz as pontuações no trecho disponível . A página de lançamento do GPT-5.5 tem uma seção de avaliações na estrutura, mas o trecho revisado não mostra os números
. A Hugging Face afirma que os resultados do DeepSeek V4 são competitivos, porém não estado da arte
. O blog da Kimi remete à reprodução dos benchmarks do Kimi-K2.6 pela API oficial, sem exibir os resultados no trecho disponível
.
Isso importa porque o vencedor muda conforme a tarefa. Programação, recuperação em contexto longo, análise visual de documentos, confiabilidade de chamadas de ferramentas, planejamento de agentes, latência e custo com cache hit versus cache miss são problemas diferentes. Sem o mesmo conjunto de testes para os quatro modelos, qualquer frase do tipo melhor modelo do mercado fica mais próxima de marketing do que de evidência.
O Claude Opus 4.7 tem a história de fonte primária mais limpa desta comparação. A Anthropic o descreve como um modelo de raciocínio híbrido que empurra a fronteira em programação e agentes de IA, com janela de contexto de 1 milhão de tokens . A página do produto também afirma que o Opus 4.7 melhora desempenho em código, visão e tarefas complexas de múltiplas etapas, com resultados melhores em trabalho profissional de conhecimento
.
O principal diferencial documentado é o contexto longo. A documentação da Anthropic diz que o Claude Opus 4.7 oferece janela de 1 milhão de tokens no preço padrão da API, sem prêmio de longo contexto . O mesmo material aponta ganhos em tarefas de conhecimento, especialmente quando o modelo precisa verificar visualmente a própria saída, como revisão de arquivos .docx, edição de apresentações .pptx, análise de gráficos e análise de figuras
.
Há dados úteis de terceiros, mas eles precisam ser lidos como tal. A Caylent afirma que o Opus 4.7 suporta até 128K tokens de saída e usa o preço padrão da linha Opus, de US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída . É uma pista relevante para planejamento, mas a afirmação de preço mais forte nas fontes primárias revisadas é a da Anthropic sobre não cobrar prêmio por longo contexto
.
A ressalva de benchmark continua valendo. O artigo da Vellum sobre o Claude Opus 4.7 lista categorias como programação, agentes, finanças, raciocínio, multimodalidade e visão, busca e segurança, mas o trecho acessível não inclui as pontuações necessárias para compará-lo diretamente a GPT-5.5, DeepSeek V4 ou Kimi K2.6 .
O GPT-5.5 está confirmado o suficiente para entrar em uma lista curta de avaliação. A documentação da API da OpenAI lista gpt-5.5 e a versão datada gpt-5.5-2026-04-23, marca o modelo como long-context e mostra faixas de limite de uso . A página de lançamento da OpenAI é de 23 de abril de 2026 e diz que GPT-5.5 e GPT-5.5 Pro ficaram disponíveis na API após uma atualização de 24 de abril de 2026
.
Isso confirma o status de API, mas não basta para uma comparação responsável com os outros três modelos. Os trechos oficiais disponíveis não informam tamanho exato de contexto, limite de saída, preço, pontuações de benchmark, modalidades, desempenho em código ou latência .
Fontes de terceiros preenchem parte das lacunas, mas não têm o mesmo peso da documentação da OpenAI. A DesignForOnline informa preço de US$ 5 por milhão de tokens de entrada e US$ 30 por milhão de tokens de saída para o GPT-5.5 . A LLM Stats relata janela de API de 1 milhão de tokens de entrada e 128K de saída, além de entrada em texto e imagem com saída em texto
. Esses números são bons candidatos para checagem com o fornecedor, não prova definitiva de fonte primária.
Leitura prática: faz sentido testar o GPT-5.5 cedo se seu produto já depende da infraestrutura da OpenAI. Mas, só com estas fontes, não dá para afirmar que ele supera Claude, DeepSeek ou Kimi em benchmarks, custo ou desempenho agentivo .
A DeepSeek tem a tabela de custos mais concreta desta comparação. Sua página de preços de API mostra contexto de 1 milhão de tokens, saída máxima de 384K, JSON output, chamadas de ferramentas, chat-prefix completion em beta e FIM completion em beta . A página também lista preços por 1 milhão de tokens para entrada com cache hit, entrada com cache miss e saída: US$ 0,028 e US$ 0,03625 para entrada com cache hit; US$ 0,14 e US$ 0,435 para entrada com cache miss; e US$ 0,28 e US$ 0,87 para saída, com observações de desconto por tempo limitado e valores sem desconto riscados no trecho
.
O quadro específico do V4 é sustentado, mas de forma mais indireta. A EvoLink afirma que a documentação oficial da DeepSeek lista deepseek-v4-flash e deepseek-v4-pro, publica preços oficiais e documenta 1 milhão de tokens de contexto mais saída máxima de 384K em 24 de abril de 2026 . A Hugging Face diz que a DeepSeek lançou o V4 com dois checkpoints mixture-of-experts: DeepSeek-V4-Pro, com 1,6T parâmetros totais e 49B ativos, e DeepSeek-V4-Flash, com 284B totais e 13B ativos
. A Hugging Face também diz que ambos têm janela de 1 milhão de tokens e que os benchmarks são competitivos, mas não estado da arte
.
A listagem do OpenRouter para V4 Pro descreve separadamente uma janela de 1.048.576 tokens e preço de US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída . Isso ajuda a triangular o cenário comercial do V4 Pro, mas equipes devem confirmar o preço atual diretamente, já que a página da DeepSeek inclui linguagem de desconto por tempo limitado
.
Leitura prática: DeepSeek V4 merece teste antecipado quando custo, contexto longo, saídas grandes, JSON output ou chamadas de ferramentas são os primeiros filtros. Isso não significa vitória automática em qualidade, confiabilidade, segurança, latência ou sucesso no uso de ferramentas; esses pontos ainda precisam de testes no seu próprio fluxo de trabalho.
O Kimi K2.6 aparece bem posicionado para os casos de uso que importam em modelos de fronteira, mas suas especificações exatas estão menos firmes nas fontes primárias disponíveis. O site da Moonshot diz que o K2.6 é nativamente multimodal e destaca capacidades de programação e desempenho em agentes . O trecho do blog técnico da Kimi afirma que os resultados oficiais de benchmark do Kimi-K2.6 devem ser reproduzidos usando a API oficial e orienta provedores de terceiros a consultar o Kimi Vendor Verifier
.
Os números mais específicos do Kimi nesta comparação vêm principalmente de terceiros. A LLM Stats diz que o Kimi K2.6 tem contexto de entrada de 262.144 tokens e pode gerar até 262.144 tokens de saída . A DesignForOnline descreve o Kimi K2.6 com contexto de 262K, visão, uso de ferramentas, function calling e preço a partir de US$ 0,7500 por milhão de tokens
. A Atlas Cloud lista preço de API a partir de US$ 0,95 por milhão de tokens
. Um artigo no LinkedIn descreve o Kimi K2.6 como open-weight, mas isso é evidência gerada por usuário e deve ser tratada com menor confiança até que a Moonshot confirme diretamente os termos de licença
.
Leitura prática: Kimi K2.6 vale avaliação para fluxos multimodais de código e agentes, mas compradores devem verificar licença, contexto, limite de saída, preço, metodologia de benchmark e compatibilidade de provedores com a Moonshot ou com uma fonte oficial de API antes de decidir produção .
gpt-5.5 na API Para decisões de produção, o caminho mais seguro é fazer um bake-off específico por tarefa, não confiar em slogans amplos. Use os mesmos prompts, ferramentas, tamanhos de contexto, arquivos de entrada e rubricas de pontuação em todos os candidatos. Meça pelo menos cinco dimensões: sucesso da tarefa, confiabilidade das chamadas de ferramentas, precisão em contexto longo, latência e custo total em tokens.
Para DeepSeek, separe custos com cache hit e cache miss, porque a página de preços divide explicitamente essas linhas . Para GPT-5.5, separe o que é confirmado pela OpenAI das alegações de terceiros sobre contexto e preço até que a documentação oficial preencha as lacunas
. Para Kimi K2.6, trate listagens de provedores e alegações open-weight geradas por usuários como pistas a verificar, não como evidência final de compra
.
Com base em evidência, não em hype, Claude Opus 4.7 é o flagship mais claramente documentado desta comparação, especialmente para contexto de 1 milhão de tokens, programação, agentes de IA e trabalho de conhecimento . DeepSeek V4 tem a evidência de preço mais forte e boa evidência de contexto longo, embora parte dos detalhes de V4 Flash/Pro apareça com mais clareza em resumos de terceiros do que no trecho de preços sozinho
. GPT-5.5 está confirmado em materiais próprios da OpenAI, mas os trechos oficiais disponíveis são finos demais para uma comparação completa de desempenho
. Kimi K2.6 tem posicionamento oficial crível em multimodalidade, código e agentes, mas muitas afirmações técnicas e comerciais exatas ainda precisam de confirmação primária mais forte
.