Google hat Gemini 4 Argon am 30. September als Spitzenmodell der neuen Gemini-4-Generation angekündigt. Es soll vor allem bei länger laufenden Aufgaben helfen – etwa in der Softwareentwicklung, bei juristischen und finanziellen Arbeitsabläufen sowie in der Cyberabwehr. Der Start ist auch deshalb bemerkenswert, weil Google damit nach monatelangen Verzögerungen ein neues Spitzenmodell vorstellt. Für die breite Öffentlichkeit ist Argon jedoch noch nicht verfügbar.
1
11
14
Für lange, mehrstufige Aufgaben gedacht
Google richtet Argon auf komplexe Abläufe aus, die mehrere Schritte erfordern und nicht mit einer kurzen Antwort erledigt sind. Als Einsatzgebiete nennt das Unternehmen Softwareentwicklung, professionelle Wissensarbeit – etwa in Recht und Finanzen – sowie Cyberabwehr.
11
Googles Entwicklerinnen und Entwickler nutzen das Modell nach Unternehmensangaben bereits zum Auffinden und Beheben von Fehlern sowie für Migrationen in bestehenden Codebasen. Das gibt einen Einblick in die vorgesehenen Einsatzfelder, ist aber keine unabhängige Prüfung der Modellleistung.
3
10
Die Benchmark-Werte – und was sie aussagen
Google meldet für Argon 77,9 Prozent bei DeepSWE v1.1, einem Test für länger angelegte Aufgaben in der Softwareentwicklung. Bei CWE-bench v1 soll das Modell 68 Prozent erreicht und damit gleichauf den ersten Platz belegt haben. Dieser Benchmark prüft, wie gut ein Modell Sicherheitslücken beheben kann.
9
10
22
Die Zahlen sind von Google veröffentlichte Ergebnisse für konkrete Tests. Sie erlauben keine pauschale Aussage darüber, welches Modell bei jeder Programmieraufgabe oder in der praktischen Sicherheitsarbeit am besten abschneidet.
10
22
Was eine Million Ausgabe-Token bedeutet
Das maximale Ausgabevolumen steigt laut Google von 64.000 auf eine Million Token. Token sind Textbausteine, aus denen ein Modell Antworten zusammensetzt. Eine höhere Obergrenze schafft Platz für deutlich längere Ausgaben – etwa umfangreiche Codeänderungen oder detaillierte Arbeitsergebnisse.
3
4
22
Wichtig ist die Unterscheidung: Die Zahl bezieht sich darauf, wie viel Argon ausgeben kann, nicht darauf, wie viel Text oder Code es als Eingabe aufnehmen kann. Ein größeres Ausgabelimit ermöglicht längere Antworten, belegt für sich genommen aber weder bessere Schlussfolgerungen noch höhere Genauigkeit bei allen Aufgaben.
Wer kann Argon nutzen?
Zum Start ist der Zugang außerhalb von Google auf ausgewählte, geprüfte Fachleute für Cyberabwehr beschränkt. Sie erhalten das Modell über Googles Fairwind-Programm. Google begründet die schrittweise Freigabe mit den fortgeschrittenen Fähigkeiten des Modells im Bereich Cyberabwehr.
2
10
11
Später soll der Zugang auf zahlende API-Kunden und Abonnenten von Google AI Ultra ausgeweitet werden. Ein verbindlicher Termin für diese breitere Freigabe ist in den vorliegenden Angaben nicht genannt. Argon ist daher angekündigt und wird begrenzt bereitgestellt – aber noch kein allgemein verfügbares Modell.
5
6
23
Warum der Start wichtig ist
Argon ist Googles nächstes Spitzenmodell und zugleich ein kontrollierter Start nach Verzögerungen bei den Plänen für eine neue KI-Generation. Mit Ergebnissen bei Programmier- und Cyberabwehrtests positioniert Google das Modell im Wettbewerb mit OpenAI und Anthropic. Die anfängliche Beschränkung auf ausgewählte Cyberabwehr-Teams zeigt zugleich, dass Google den Zugang zunächst steuern will.
1
14
Vorerst sind vor allem drei Punkte greifbar: die vorgesehenen Einsatzbereiche, die ungewöhnlich hohe Grenze für Ausgaben und Googles eigene Benchmark-Angaben. Wie gut Argon sich in der breiteren Praxis schlägt, lässt sich besser beurteilen, sobald mehr Nutzerinnen und Nutzer es für unterschiedliche Aufgaben testen können.