Sommige Google medewerkers vinden Gemini 4 Argon minder betrouwbaar bij praktische programmeertaken dan de sterke benchmarkresultaten doen vermoeden, vooral bij bepaalde taken en front endontwikkeling. Binnen Google zijn de meningen verdeeld over de voorsprong van Anthropic en OpenAI.
Gepubliceerd doorBewerkt met GPT-6 LunaAfbeeldingen gegenereerd met GPT Image 2
Research answer

Create a landscape editorial hero image for this Studio Global article: Why are some Google employees questioning the forthcoming Gemini 4 model’s real-world coding ability despite strong benchmark scores, how do. Article summary: Some employees say Gemini 4 Argon’s strong benchmark scores do not match their experience using it for actual coding work, particularly certain tasks and front-end design. That is a reported internal assessment, not a se. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Googles nieuwe topmodel Gemini 4 Argon krijgt twee verschillende beoordelingen. Het bedrijf wijst op sterke scores in verschillende benchmarktests, terwijl sommige medewerkers volgens berichtgeving zeggen dat het model minder goed uit de verf komt wanneer zij het inzetten voor praktisch programmeerwerk. Dat verschil is relevant, maar de gemelde interne kritiek is geen bewijs dat Gemini 4 achterloopt op alle concurrenten — binnen Google lopen de meningen uiteen. 11
Google zegt dat Gemini 4 goed presteerde op verschillende benchmarks. Bij een test voor beveiligingsvaardigheden scoorde het model volgens het bedrijf hoger dan OpenAI’s Astra. Medewerkers die met het model hebben gewerkt, zouden daarentegen problemen hebben ervaren bij bepaalde praktische programmeertaken, waaronder front-endontwikkeling: het bouwen van de zichtbare en interactieve kant van websites en apps. 11
14
Een benchmark meet prestaties op een afgebakende test. Dat is nuttige informatie, maar vertelt niet automatisch hoe consistent een model is bij uiteenlopende opdrachten uit het dagelijkse werk. Andersom bewijzen kritische ervaringen met specifieke taken niet dat de benchmarkresultaten onjuist zijn. De twee soorten beoordelingen beantwoorden deels verschillende vragen.
Google bestrijdt de typering dat Gemini 4 tekortschiet bij programmeren en verwijst naar de sterke testresultaten. Ook binnen het bedrijf is er geen eensgezind oordeel: sommige medewerkers zouden denken dat Anthropic’s Fable en OpenAI’s Astra zich sneller ontwikkelen, terwijl anderen vinden dat Gemini 4 de toonaangevende modellen heeft bijgehaald. 11
12
13
Daarom is het te vroeg om de gemelde kritiek van sommige medewerkers, of Googles beroep op benchmarks, als een definitief oordeel over het model te zien.
Google was van plan Gemini 3.5 Pro in juni 2026 uit te brengen, maar liet die versie vallen en ging verder met Gemini 4, volgens berichtgeving. Dat geeft context bij vragen over Googles ontwikkel- en uitroltempo. Op zichzelf verklaart het echter niet waarom sommige medewerkers twijfelen aan de programmeerprestaties van Gemini 4, en het bewijst niet dat het model minder goed is. 6
13
Na het bericht leverden Alphabet-aandelen een eerdere stijging van meer dan 2% deels in. In de betreffende woensdagse handel stonden ze uiteindelijk ongeveer 0,5% hoger. Die koersbeweging viel samen met de berichtgeving, maar bewijst niet dat de gemelde zorgen terecht zijn of dat die zorgen de beweging veroorzaakten. 1
14
Voor beleggers staat ook de bredere vraag op het spel of Google met zijn topmodellen kan concurreren met OpenAI en Anthropic. Gemini 4 is onderdeel van die strijd, maar de berichtgeving stelt geen concrete gevolgen voor afzonderlijke Google-producten vast. Een bredere impact blijft dus een mogelijkheid, geen aangetoond gevolg. 10
Studio Global AI
This page includes a source-backed answer you can continue inside Studio Global.
Sommige Google medewerkers vinden Gemini 4 Argon minder betrouwbaar bij praktische programmeertaken dan de sterke benchmarkresultaten doen vermoeden, vooral bij bepaalde taken en front endontwikkeling.
Sommige Google medewerkers vinden Gemini 4 Argon minder betrouwbaar bij praktische programmeertaken dan de sterke benchmarkresultaten doen vermoeden, vooral bij bepaalde taken en front endontwikkeling. Binnen Google zijn de meningen verdeeld over de voorsprong van Anthropic en OpenAI.