Google ha annunciato Gemini 4 Argon il 30 settembre, presentandolo come il modello di punta della nuova generazione Gemini 4. È pensato per attività articolate e di lunga durata: dallo sviluppo software al lavoro professionale, fino alla difesa informatica. L’annuncio segna anche l’arrivo del nuovo modello di frontiera di Google dopo mesi di rinvii, ma non coincide con un’apertura al pubblico.
1
11
14
A cosa serve Argon
Google propone Argon per flussi di lavoro complessi in ambiti come l’ingegneria del software, il settore legale e quello finanziario, oltre alla cybersicurezza. L’obiettivo è affrontare compiti con più passaggi e che richiedono un lavoro prolungato, non soltanto rispondere a singole domande brevi.
11
Secondo Google, i suoi ingegneri usano già il modello per attività come il debugging e le migrazioni di codebase. Sono esempi interni degli impieghi previsti, non valutazioni indipendenti delle sue prestazioni.
3
10
I benchmark: i risultati dichiarati da Google
Google riporta un punteggio del 77,9% su DeepSWE v1.1, un benchmark per attività di ingegneria software complesse e di lunga durata. Afferma inoltre che Argon ha ottenuto il 68% su CWE-bench v1, raggiungendo il primo posto a pari merito in una prova legata alla correzione delle vulnerabilità di sicurezza.
9
10
22
Sono risultati comunicati da Google e riferiti a benchmark specifici: non costituiscono una classifica universale tra modelli e non dimostrano che Argon sia il migliore in ogni attività di programmazione o sicurezza informatica. Le informazioni disponibili non bastano a stabilire come si comporti in tutti gli scenari d’uso reali.
10
22
Che cosa significa un output da un milione di token
Il limite massimo di output di Argon passa da 64.000 a un milione di token, secondo l’annuncio di Google e le ricostruzioni del lancio. In pratica, il modello può generare risposte molto più lunghe in un singolo output: una capacità potenzialmente utile per produrre grandi quantità di codice o documenti estesi.
3
4
22
È importante distinguere tra output e input: il milione di token indica quanto il modello può produrre, non quanto testo o codice può ricevere. Un limite di output più alto permette generazioni più lunghe, ma da solo non dimostra che il modello ragioni con maggiore precisione o sia più efficace in ogni compito.
Chi può usare Gemini 4 Argon
Al lancio, fuori da Google l’accesso è limitato a difensori informatici selezionati attraverso il programma Fairwind. Google ha descritto la distribuzione graduale come un approccio prudente per un modello dotato di capacità avanzate di difesa informatica.
2
10
11
In seguito, l’azienda prevede di estendere l’accesso ai clienti API a pagamento e agli abbonati a Google AI Ultra. Le informazioni disponibili non indicano una data precisa per l’apertura più ampia: per ora, quindi, Argon è in fase di distribuzione limitata e non è disponibile al pubblico in generale.
5
6
23
Perché il lancio è rilevante
Argon è il nuovo modello di frontiera di Google e arriva dopo rinvii nei piani per la generazione successiva dei suoi sistemi di IA. L’azienda mette in evidenza i risultati nei benchmark di programmazione e cybersicurezza per posizionarlo rispetto ai modelli concorrenti, ma per ora ne riserva l’accesso iniziale a un gruppo selezionato di difensori informatici.
1
14
Per il momento, i dati più concreti riguardano gli ambiti d’uso previsti, il tetto di output e i risultati dichiarati da Google. Sarà possibile valutare meglio le prestazioni nella pratica quando l’accesso si allargherà e più utenti indipendenti potranno provarlo su una gamma più ampia di attività.