Segundo relatos, alguns funcionários dizem que os bons resultados do Gemini 4 Argon em benchmarks não se repetem em certas tarefas práticas de programação, incluindo desenvolvimento front end. As opiniões sobre os modelos da Anthropic e da OpenAI são divergentes, e o Google contesta a crítica.
Publicado porEditado com GPT-6 LunaImagens geradas com GPT Image 2
Resposta de pesquisa

Create a landscape editorial hero image for this Studio Global article: Why are some Google employees questioning the forthcoming Gemini 4 model’s real-world coding ability despite strong benchmark scores, how do. Article summary: Some employees say Gemini 4 Argon’s strong benchmark scores do not match their experience using it for actual coding work, particularly certain tasks and front-end design. That is a reported internal assessment, not a se. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
O Gemini 4 Argon recebeu avaliações diferentes: o Google destaca resultados de ponta em benchmarks, enquanto alguns funcionários relatam que o modelo é menos consistente quando usado em tarefas reais de programação. A divergência merece atenção, mas os relatos apontam opiniões internas variadas — não um consenso de que o Gemini 4 esteja atrás dos concorrentes. 11
O Google afirma que o Gemini 4 teve bom desempenho em vários benchmarks, incluindo um teste de segurança no qual superou o modelo Astra, da OpenAI. Já funcionários familiarizados com avaliações internas relatam dificuldades em algumas tarefas práticas de programação, entre elas atividades de desenvolvimento front-end. 11
14
Esses relatos não anulam os resultados dos testes — assim como os benchmarks, por si só, não respondem a todas as perguntas sobre o uso do modelo no trabalho cotidiano de engenharia. A questão é a diferença entre pontuar bem em avaliações específicas e ser útil e consistente em tarefas concretas.
O Google afirma que seria incorreto dizer que o Gemini 4 tem desempenho abaixo do esperado em programação e aponta seus resultados nos benchmarks. Os relatos sobre o que funcionários pensam, por sua vez, não são unânimes: alguns acreditam que os modelos Fable, da Anthropic, e Astra, da OpenAI, estão avançando mais rápido; outros avaliam que o Gemini 4 alcançou os principais concorrentes. 11
12
13
Com opiniões tão distintas, é cedo para tratar tanto as críticas internas quanto os resultados apresentados pela empresa como uma avaliação definitiva das capacidades do Gemini 4.
Segundo relatos, o Google planejava lançar o Gemini 3.5 Pro em junho de 2026, mas abandonou essa versão e passou ao Gemini 4. O histórico ajuda a contextualizar as perguntas sobre o ritmo de desenvolvimento e lançamento da empresa, mas, por si só, não explica as dificuldades de programação atribuídas ao Gemini 4 nem demonstra que o modelo seja inferior. 6
13
Após a publicação da reportagem, as ações da Alphabet devolveram parte de uma alta anterior superior a 2% e terminaram a sessão de quarta-feira com ganho de cerca de 0,5%. A oscilação indica que a notícia coincidiu com uma mudança no sentimento do mercado; não comprova que as preocupações dos funcionários estejam corretas nem que tenham causado a variação. 1
14
A questão mais ampla para investidores é se o Google conseguirá competir com a OpenAI e a Anthropic na disputa por modelos de IA de ponta. A cobertura situa o Gemini 4 nesse cenário, mas não aponta efeitos específicos sobre produtos individuais do Google. Qualquer impacto mais amplo continua sendo uma possibilidade em aberto, não um resultado demonstrado. 10
Studio Global AI
Esta página inclui uma resposta baseada na fonte que você pode continuar em Studio Global.
Segundo relatos, alguns funcionários dizem que os bons resultados do Gemini 4 Argon em benchmarks não se repetem em certas tarefas práticas de programação, incluindo desenvolvimento front end.
Segundo relatos, alguns funcionários dizem que os bons resultados do Gemini 4 Argon em benchmarks não se repetem em certas tarefas práticas de programação, incluindo desenvolvimento front end. As opiniões sobre os modelos da Anthropic e da OpenAI são divergentes, e o Google contesta a crítica.