Composer 2.5: o novo modelo de IA da Cursor para programação chega com benchmarks competitivos e preço agressivo
O Composer 2.5, lançado em 18 de maio de 2026, alcança 79,8% no SWE‑Bench Multilingual e 69,3% no Terminal‑Bench 2.0, ficando próximo de Claude Opus 4.7 e GPT‑5.5 em tarefas de programação. O modelo foi criado para fluxos de trabalho completos de engenharia de software dentro do Cursor IDE, incluindo navegação em re...
Publicado porEditado com GPT-5.5Imagens geradas com GPT Image 2
O Composer 2.5, lançado em 18 de maio de 2026, alcança 79,8% no SWE‑Bench Multilingual e 69,3% no Terminal‑Bench 2.0, ficando próximo de Claude Opus 4.7 e GPT‑5.5 em tarefas de programação.
O modelo foi criado para fluxos de trabalho completos de engenharia de software dentro do Cursor IDE, incluindo navegação em repositórios grandes, edição de múltiplos arquivos e execução de testes.
Com preços de cerca de US$0,50 por milhão de tokens de entrada e US$2,50 por milhão de tokens de saída, o Composer 2.5 pode reduzir drasticamente o custo de agentes de programação de longa duração.
Cursor Composer 2.5: Benchmarks, Pricing, and How It Stacks Up to Claude Opus 4.7 and GPT‑5.5Cursor’s Composer 2.5 aims to deliver frontier‑level coding performance while dramatically lowering the cost of running AI coding agents.
Prompt de IA
Create a landscape editorial hero image for this Studio Global article: Cursor Composer 2.5: Benchmarks, Pricing, and How It Stacks Up to Claude Opus 4.7 and GPT‑5.5. Article summary: Cursor’s Composer 2.5 is an in‑house coding model released May 18, 2026 that scores about 79.8% on SWE‑Bench Multilingual and 69.3% on Terminal‑Bench 2.0—roughly matching Claude Opus 4.7 on some benchmarks while costi.... Topic tags: cursor, ai coding, developer tools, ai models, benchmarks. Reference image context from search candidates: Reference image 1: visual subject "Composer 2.5 matches Opus 4.7 and GPT-5.5 on CursorBench 3.1 but costs less than a dollar per task - compared to up to eleven dollars for the competition. | Image: Cursor" source context "Cursor's Composer 2.5 matches Opus 4.7 and GPT-5.5 benchmarks ..." Reference image 2: visual subject "Composer 2.5 vs Opus | The Results Are Brutal Merv
openai.com
A Cursor, empresa por trás do popular Cursor IDE, lançou em 18 de maio de 2026 o Composer 2.5, seu modelo mais recente voltado especificamente para programação assistida por IA. A nova versão foi criada para lidar com tarefas complexas de engenharia de software — desde explorar grandes repositórios até editar vários arquivos, executar comandos de terminal e iterar testes automaticamente.
O lançamento chamou atenção por dois motivos principais: desempenho competitivo em benchmarks de programação comparável a modelos de ponta e preços muito mais baixos, algo que pode mudar a economia de ferramentas de desenvolvimento baseadas em IA.
Studio Global AI
Continue sua pesquisa
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Qual é a resposta curta para "Composer 2.5: o novo modelo de IA da Cursor para programação chega com benchmarks competitivos e preço agressivo"?
O Composer 2.5, lançado em 18 de maio de 2026, alcança 79,8% no SWE‑Bench Multilingual e 69,3% no Terminal‑Bench 2.0, ficando próximo de Claude Opus 4.7 e GPT‑5.5 em tarefas de programação.
Quais são os pontos-chave para validar primeiro?
O Composer 2.5, lançado em 18 de maio de 2026, alcança 79,8% no SWE‑Bench Multilingual e 69,3% no Terminal‑Bench 2.0, ficando próximo de Claude Opus 4.7 e GPT‑5.5 em tarefas de programação. O modelo foi criado para fluxos de trabalho completos de engenharia de software dentro do Cursor IDE, incluindo navegação em repositórios grandes, edição de múltiplos arquivos e execução de testes.
O que devo fazer a seguir na prática?
Com preços de cerca de US$0,50 por milhão de tokens de entrada e US$2,50 por milhão de tokens de saída, o Composer 2.5 pode reduzir drasticamente o custo de agentes de programação de longa duração.
Foco em fluxos completos de engenharia de software
Diferentemente de assistentes que apenas sugerem trechos de código, a linha Composer foi desenvolvida para "agentic software engineering" — ou seja, agentes capazes de executar etapas completas de desenvolvimento.
Na prática, isso inclui:
Planejar mudanças em um repositório inteiro
Editar múltiplos arquivos
Compilar e executar testes
Depurar código de forma iterativa
Segundo a Cursor, o Composer 2.5 melhora a confiabilidade em tarefas longas, segue instruções complexas com mais consistência e coopera melhor em sessões de desenvolvimento dentro do IDE.
Esse tipo de fluxo representa uma evolução dos assistentes de programação: em vez de simples autocompletar, a IA passa a atuar como um agente persistente dentro do ambiente de desenvolvimento.
Desempenho em benchmarks frente a Claude Opus 4.7 e GPT‑5.5
Nos testes divulgados pela Cursor e por análises independentes, o Composer 2.5 aparece na mesma faixa de desempenho de modelos líderes em várias tarefas de engenharia de software.
No SWE‑Bench Multilingual, que mede a capacidade da IA de resolver problemas reais de repositórios no GitHub em diferentes linguagens, o Composer 2.5 fica praticamente no mesmo nível dos líderes e supera o GPT‑5.5 na comparação divulgada.
No Terminal‑Bench 2.0, voltado para agentes que executam tarefas via terminal, ele praticamente empata com o Claude Opus 4.7, mas fica bem atrás do GPT‑5.5.
Em relação à geração anterior, a melhoria também é significativa. O modelo anterior, Composer 2, registrava 73,7% no SWE‑Bench Multilingual, enquanto a nova versão sobe para 79,8%.
O preço pode ser o verdadeiro diferencial
O aspecto mais chamativo do Composer 2.5 é o custo.
A Cursor divulgou os seguintes preços aproximados:
US$0,50 por milhão de tokens de entrada
US$2,50 por milhão de tokens de saída
Existe também uma variante mais rápida, com:
US$3,00 por milhão de tokens de entrada
US$15,00 por milhão de tokens de saída.
Para comparação, estimativas colocam modelos como o Claude Opus 4.7 perto de US$5 por milhão de tokens de entrada e US$25 por milhão de tokens de saída, o que significa que o Composer 2.5 pode custar uma fração do preço — especialmente na geração de respostas.
Essa diferença importa porque agentes de programação consomem enormes quantidades de tokens. Uma única tarefa pode envolver:
análise do repositório
planejamento de alterações
edição de arquivos
compilação
execução de testes
Cada etapa dispara novas chamadas ao modelo. Preços menores permitem executar mais ciclos de raciocínio e automação sem explodir o custo.
Base tecnológica e treinamento
O Composer 2.5 foi construído sobre o checkpoint Kimi K2.5, da Moonshot AI, um modelo open‑weight que a Cursor usa como base antes de aplicar treinamento adicional especializado.
Relatos sobre o processo de treinamento indicam que a empresa investiu fortemente em dados sintéticos e reforço:
cerca de 25 vezes mais tarefas sintéticas de programação em comparação com a geração anterior
aproximadamente 85% do orçamento de computação dedicado a treinamento adicional e reinforcement learning.
Essas tarefas simuladas permitem treinar o modelo repetidamente em cenários típicos de engenharia de software, como planejar mudanças, editar código, executar testes e corrigir erros.
Parte de uma estratégia maior da Cursor
O Composer 2.5 também revela uma mudança estratégica importante para a empresa.
Nas primeiras versões do Cursor, o IDE dependia principalmente de modelos externos, como os da OpenAI, Anthropic e Google, para alimentar seus recursos de programação assistida.
Ao desenvolver seus próprios modelos, a empresa ganha vantagens importantes:
custos de inferência menores para agentes que executam tarefas longas
menor dependência de fornecedores externos de IA
mais controle sobre o comportamento do modelo dentro do IDE
Isso também ajuda a Cursor a competir com soluções integradas como Claude Code, da Anthropic, onde o mesmo fornecedor controla tanto o modelo quanto o agente de programação.
O que isso significa para o futuro do desenvolvimento com IA
O Composer 2.5 ainda não domina todos os benchmarks — o GPT‑5.5 continua liderando alguns testes de agentes, e o Claude Opus 4.7 permanece altamente competitivo.
Mesmo assim, a combinação de desempenho próximo ao nível de modelos de ponta e custo muito menor pode ter impacto real no mercado. Se a Cursor continuar melhorando seus modelos internos mantendo essa vantagem de preço, o custo de executar agentes de programação dentro de IDEs pode cair drasticamente — algo que pode acelerar a adoção de IA em fluxos completos de desenvolvimento de software.