Berichten zufolge testen Google-Mitarbeiter eine interne Version von Gemini 4 mit dem Codenamen Carbon in der unternehmenseigenen Entwicklungsumgebung Jetski. Ein Tester soll gesagt haben, das Programmieren damit „fühle sich an wie mit Opus 5.5“ – Anthropic-Modell für lang laufende, agentische Programmieraufgaben. Das ist allerdings ein erster Eindruck und kein veröffentlichter Direktvergleich.
29
25 In den verfügbaren Berichten gibt es weder einen bestätigten Carbon-Benchmark noch einen öffentlichen Starttermin.
48
Was Google-Mitarbeiter über Carbon berichten
Business Insider berichtete unter Berufung auf interne Dokumente und Screenshots, dass Mitarbeiter Carbon getestet hätten.
29 Das Feedback sei positiv gewesen. Ein Mitarbeiter verglich die Programmierleistung vorsichtig mit Claude Opus 5.5 und betonte zugleich, dass weitere Tests nötig seien.
29
25
Diese Einschränkung ist wichtig: Ein subjektiver Eindruck kann darauf hindeuten, dass eine Modellversion vielversprechend ist. Er belegt aber nicht, wie sie bei unterschiedlichen Aufgaben abschneidet, wie zuverlässig sie in längeren Arbeitsabläufen mit KI-Agenten funktioniert oder ob sie unter kontrollierten Bedingungen mit einem Konkurrenzmodell mithält. Die verfügbaren Berichte enthalten keinen vergleichenden Benchmark speziell für Carbon.
29
48
Auch Googles öffentliche Pläne sind unklar. Weder ein endgültiger Produktname noch die genaue Beziehung zu Argon oder eine Veröffentlichung von Carbon sind bestätigt.
25
48
Wie Carbon mit Gemini 4 Argon zusammenhängt
Die Codenamen bezeichnen interne Modellversionen – sie bilden keine bestätigte Abfolge öffentlicher Produkte ab. Laut Business-Insider-Berichten testete Google Gemini-4-Versionen mit den Namen Argon, Barium und Carbon. Ein Bericht, der sich auf ein internes Dokument stützt, besagt, dass die Version Barium-B für das öffentlich als Gemini 4 Argon angekündigte Modell ausgewählt wurde.
25
Daraus geht nicht hervor, wo genau Carbon in die Modellreihe gehört. Carbon könnte ein späterer Entwicklungsstand oder eine weitere Version der Gemini-4-Familie sein. Die Berichte bestätigen aber weder die genaue Abstammung noch, ob Carbon unter dem Namen Argon erscheinen würde.
25
48
Google kündigte Gemini 4 Argon am 30. September 2026 an. Zunächst sollte das Modell über das Fairwind-Programm ausgewählten, vertrauenswürdigen Cybersicherheitsexperten zur Verfügung gestellt werden.
36
4 Auch Berichte vom 9. Oktober bezeichneten Argon noch als nicht öffentlich verfügbar. Bezahlte API-Kunden und Abonnenten von Google AI Ultra wurden als mögliche Gruppen für eine spätere Ausweitung des Zugangs genannt – zu diesem Zeitpunkt war ein allgemeiner Zugang für sie jedoch nicht bestätigt.
48
16
Laut Googles Angaben erreicht Argon 77,9 Prozent bei DeepSWE v1.1. Außerdem wurde das Ausgabelimit des Modells von 64.000 auf eine Million Token erhöht.
4 Beides sind Angaben zu Argon, nicht zu Carbon. Drittanbieter-Berichte nannten einen Einführungspreis von 2 US-Dollar pro Million Eingabe-Token und 10 US-Dollar pro Million Ausgabe-Token. Die hier verfügbaren Quellen enthalten jedoch keine offizielle Preisliste.
5
Die Debatte um Argons Programmierleistung ist eine andere Frage
In separaten Berichten ging es um eine mögliche Lücke zwischen Argons Benchmark-Ergebnissen und den Erfahrungen einiger Mitarbeiter mit praktischen Programmieraufgaben, darunter Frontend-Arbeit. Google widersprach der Darstellung, Argon sei beim Programmieren schwach.
2
9 Diese Debatte betrifft Argon und lässt sich nicht als Beleg für die Leistung von Carbon heranziehen.
Ein weiterer Bericht besagt, dass frühe interne Argon-Versionen einen Mitarbeiter bei manchen Programmieraufgaben an das ältere Opus 5 von Anthropic erinnerten. Carbon erhielt später den günstigeren Vergleich mit Opus 5.5.
30 Beides sind berichtete Einschätzungen einzelner Mitarbeiter, keine kontrollierten Tests. Google beschreibt Argon in seiner offiziellen Ankündigung als Frontier-Modell für komplexe, lang laufende Arbeitsabläufe. Das bestätigt jedoch nicht unabhängig die gemeldete Leistung von Carbon.
36
Das vorsichtige Fazit: Zumindest ein berichteter Tester hält Carbon für vielversprechend. Wie leistungsfähig das Modell tatsächlich ist und ob es jemals als Produkt erscheint, bleibt offen. Solange es keine Testergebnisse speziell für Carbon oder eine bestätigte Veröffentlichung gibt, sollte der Vergleich mit Claude Opus 5.5 als vorläufiges internes Feedback verstanden werden – nicht als nachgewiesene Gleichwertigkeit.
25
29
48