Algunos empleados afirman que los buenos resultados de Gemini 4 Argon en pruebas comparativas no siempre se reflejan en tareas de programación, especialmente en ciertos trabajos de desarrollo front end. Las opiniones internas sobre Anthropic y OpenAI están divididas.
Publicado porEditado con GPT-6 LunaImágenes generadas con GPT Image 2
Respuesta de investigación

Create a landscape editorial hero image for this Studio Global article: Why are some Google employees questioning the forthcoming Gemini 4 model’s real-world coding ability despite strong benchmark scores, how do. Article summary: Some employees say Gemini 4 Argon’s strong benchmark scores do not match their experience using it for actual coding work, particularly certain tasks and front-end design. That is a reported internal assessment, not a se. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
El debate en torno a Gemini 4 Argon no es si obtuvo buenas puntuaciones en pruebas: Google sostiene que sí. La pregunta es cuánto reflejan esas evaluaciones el trabajo cotidiano de programación. Algunas personas con acceso al modelo dentro de la compañía dicen que su rendimiento práctico puede ser menos sólido, aunque las opiniones entre empleados no son unánimes. 11
Google ha destacado los resultados de Gemini 4 en varias evaluaciones comparativas, incluidas pruebas de seguridad. En una de ellas, según la empresa, superó al modelo Astra de OpenAI. Sin embargo, empleados familiarizados con las evaluaciones internas describen dificultades en ciertas tareas de programación, entre ellas el desarrollo de interfaces front-end: la parte de una web o aplicación con la que interactúan las personas. 11
14
Las dos cosas pueden ser ciertas a la vez: un modelo puede sobresalir en pruebas diseñadas para medir capacidades concretas y ofrecer resultados menos consistentes en tareas reales. Los informes citados no demuestran que Gemini 4 sea inferior en términos generales; señalan una posible distancia entre algunas puntuaciones y la experiencia práctica de ciertos usuarios.
Google considera inexacto decir que Gemini 4 rinde por debajo de lo esperado en programación y ha remitido a sus resultados en las pruebas comparativas. Por su parte, los testimonios internos recogidos en los informes no expresan una postura única: algunos empleados creen que los modelos Fable de Anthropic y Astra de OpenAI están avanzando más rápido; otros opinan que Gemini 4 ya alcanzó a los modelos punteros. 11
12
13
Por eso, las críticas internas no bastan para emitir un veredicto definitivo, del mismo modo que los buenos resultados en pruebas no resuelven por sí solos cómo se comporta el modelo en cada tipo de trabajo.
Google había previsto lanzar Gemini 3.5 Pro en junio de 2026, pero abandonó esa versión y pasó a Gemini 4, según los informes. Ese cambio ayuda a entender por qué se escruta el ritmo de desarrollo de la compañía, aunque no explica por sí mismo las dudas sobre la programación ni demuestra que Gemini 4 sea peor que sus competidores. 6
13
Tras conocerse la noticia, las acciones de Alphabet redujeron una subida previa de más del 2 % y cerraron la sesión del miércoles con un avance de alrededor del 0,5 %. El movimiento coincidió con la publicación del informe, pero no prueba que las preocupaciones de los empleados sean correctas ni que hayan sido la causa única del cambio en la cotización. 1
14
La cuestión de fondo para los inversores es si Google puede competir con OpenAI y Anthropic en modelos de inteligencia artificial de primera línea. Gemini 4 es una pieza emblemática de esa competencia, pero la información disponible no identifica efectos concretos en productos individuales de Google. Por ahora, cualquier impacto más amplio sigue siendo una incógnita, no un resultado demostrado. 10
Studio Global AI
Esta página incluye una respuesta respaldada por fuentes que puede continuar dentro de Studio Global.
Algunos empleados afirman que los buenos resultados de Gemini 4 Argon en pruebas comparativas no siempre se reflejan en tareas de programación, especialmente en ciertos trabajos de desarrollo front end.
Algunos empleados afirman que los buenos resultados de Gemini 4 Argon en pruebas comparativas no siempre se reflejan en tareas de programación, especialmente en ciertos trabajos de desarrollo front end. Las opiniones internas sobre Anthropic y OpenAI están divididas. Google también dejó de lado su plan de lanzar Gemini 3.5 Pro, un antecedente que añade contexto a las dudas sobre su calendario de desarrollo.