Einige Mitarbeitende sagen, Gemini 4 Argon sei bei bestimmten praktischen Programmieraufgaben weniger zuverlässig, als seine starken Benchmark Ergebnisse vermuten lassen – besonders bei der Frontend Entwicklung. Die Einschätzungen zu Anthropic und OpenAI sind intern geteilt.
Veröffentlicht vonBearbeitet mit GPT-6 LunaBilder erstellt mit GPT Image 2
Forschungsantwort

Create a landscape editorial hero image for this Studio Global article: Why are some Google employees questioning the forthcoming Gemini 4 model’s real-world coding ability despite strong benchmark scores, how do. Article summary: Some employees say Gemini 4 Argon’s strong benchmark scores do not match their experience using it for actual coding work, particularly certain tasks and front-end design. That is a reported internal assessment, not a se. Topic tags: general, general web, news, user generated. Style: premium digital editorial illustration, source-backed research mood, clean composition, high detail, modern web publication hero. Use reference image context only for broad subject, composition, and topical grounding; do not copy the exact image. Avoid: logos, brand marks, copyrighted characters, real person likenesses, fake screenshots, UI text, readable text, watermarks, charts w
Googles neues KI-Modell Gemini 4 Argon wird von zwei Seiten unterschiedlich bewertet: Das Unternehmen verweist auf starke Ergebnisse in mehreren Benchmarks, während einige Mitarbeitende laut Berichten bei praktischen Programmieraufgaben Schwächen beobachten. Diese Diskrepanz ist relevant – die Berichte sprechen jedoch von unterschiedlichen Einschätzungen innerhalb des Unternehmens, nicht von einem gemeinsamen Urteil, Gemini 4 liege hinter der Konkurrenz. 11
Google zufolge erzielte Gemini 4 bei mehreren Benchmarks Spitzenwerte. Bei einem Test zu Sicherheitsfähigkeiten habe das Modell OpenAIs Astra übertroffen. Mitarbeitende, die mit internen Bewertungen vertraut sind, schildern laut Berichten ein anderes Bild bei bestimmten Aufgaben aus dem Programmieralltag, darunter Frontend-Entwicklung. 11
14
Das eine widerlegt das andere nicht: Gute Ergebnisse in ausgewählten Tests beantworten nicht automatisch, wie verlässlich ein Modell bei alltäglichen Entwicklungsaufgaben ist. Umgekehrt belegen einzelne kritische Erfahrungen nicht, dass die Benchmark-Ergebnisse falsch sind. Sie zeigen vielmehr, dass Testergebnisse und der praktische Nutzen bei konkreten Aufgaben auseinanderfallen können.
Google hält es für unzutreffend, Gemini 4 beim Programmieren als unterdurchschnittlich darzustellen, und verweist auf die Benchmark-Ergebnisse. Auch die Einschätzungen der Mitarbeitenden sind nicht einheitlich: Einige sollen glauben, dass Anthropic mit Fable und OpenAI mit Astra schneller Fortschritte machen. Andere halten Gemini 4 für konkurrenzfähig und sehen das Modell inzwischen auf Augenhöhe mit führenden Systemen. 11
12
13
Deshalb wäre es verfrüht, entweder die interne Kritik oder Googles Verweis auf Benchmarks als abschließendes Urteil über Gemini 4 zu betrachten.
Google hatte nach Berichten zunächst geplant, Gemini 3.5 Pro im Juni 2026 zu veröffentlichen. Diese Version wurde jedoch aufgegeben, bevor das Unternehmen auf Gemini 4 setzte. Das ist zusätzlicher Kontext für Fragen zum Entwicklungs- und Veröffentlichungstempo. Für sich genommen erklärt es aber weder die berichteten Schwierigkeiten beim Programmieren noch belegt es, dass Gemini 4 schlechter ist. 6
13
Nach dem Bericht gab die Alphabet-Aktie einen zuvor erzielten Kursgewinn von mehr als zwei Prozent teilweise wieder ab und lag in der betreffenden Mittwochssitzung am Ende noch etwa 0,5 Prozent im Plus. Die Bewegung fiel zeitlich mit der Berichterstattung zusammen. Sie beweist weder, dass die Bedenken der Mitarbeitenden zutreffen, noch dass diese allein die Kursentwicklung ausgelöst haben. 1
14
Für Anleger steht die größere Frage im Raum, wie Google im Wettbewerb um führende KI-Modelle mit OpenAI und Anthropic mithalten kann. Gemini 4 ist Teil dieses Wettbewerbs. Die Berichte belegen jedoch keine konkreten Auswirkungen auf einzelne Google-Produkte; mögliche Folgen über den Modellstart hinaus bleiben daher offen. 10
Studio Global AI
Diese Seite enthält eine quellengestützte Antwort, die Sie in Studio Global fortsetzen können.
Einige Mitarbeitende sagen, Gemini 4 Argon sei bei bestimmten praktischen Programmieraufgaben weniger zuverlässig, als seine starken Benchmark Ergebnisse vermuten lassen – besonders bei der Frontend Entwicklung.
Einige Mitarbeitende sagen, Gemini 4 Argon sei bei bestimmten praktischen Programmieraufgaben weniger zuverlässig, als seine starken Benchmark Ergebnisse vermuten lassen – besonders bei der Frontend Entwicklung. Die Einschätzungen zu Anthropic und OpenAI sind intern geteilt. Google bestreitet, dass Gemini 4 beim Programmieren hinter den Erwartungen zurückbleibt.
Die aufgegebene Planung für Gemini 3.5 Pro und eine Kursbewegung der Alphabet Aktie liefern zusätzlichen Kontext, sind aber kein Beweis für die Qualität des Modells.