| GPT-5.6 Terra | 2 $ | 12 $ | -20%, da 2,50 $ / 15 $ |
| GPT-5.6 Sol | 5 $ | 30 $ | Invariato |
Luna, il modello più economico e veloce della famiglia, ha quindi un costo complessivo di 1,40 dollari per milione di token considerando input e output. Terra scende a 14 dollari complessivi per milione di token.
Per Sol, OpenAI ha introdotto la modalità Fast: può offrire una velocità fino a 2,5 volte superiore rispetto alla modalità Standard, al doppio del prezzo, senza una riduzione delle capacità del modello .
I token sono le unità con cui i sistemi di IA misurano il testo elaborato e generato. Per chi gestisce applicazioni ad alto volume — per esempio classificazione, estrazione di dati o chatbot — anche pochi centesimi per milione possono incidere sensibilmente sul conto finale.
L’aspetto più insolito della riduzione riguarda il modo in cui OpenAI dichiara di aver ottenuto parte dei risparmi. Il 29 luglio la società ha spiegato che GPT-5.6 Sol ha riscritto e ottimizzato autonomamente i kernel GPU in produzione: il codice di basso livello che permette ai modelli di funzionare sull’hardware .
Attraverso l’ambiente di sviluppo Codex, Sol si sarebbe collegato all’infrastruttura interna di OpenAI, progettando e svolgendo centinaia di esperimenti architetturali, avviando e monitorando i deployment e correggendo il lavoro sulla base dei risultati . Il modello ha inoltre appreso la sintassi di Triton e Gluon, linguaggi impiegati nello stack dei kernel di OpenAI .
Secondo i dati comunicati da OpenAI, le ottimizzazioni hanno prodotto:
Lo speculative decoding è una tecnica che utilizza un modello più piccolo, detto “modello bozza”, per prevedere i token successivi e accelerare l’inferenza. In questo modo il modello principale deve svolgere meno lavoro per produrre la risposta finale.
I risparmi non derivano però soltanto dai kernel. Le ricostruzioni disponibili citano anche una revisione del load balancing, cioè della distribuzione dinamica delle richieste in base a posizione geografica, tipo di acceleratore e disponibilità della cache .
Anche il prompt caching può ridurre la spesa: con una durata della cache di circa 30 minuti, gli input già memorizzati possono costare il 90% in meno rispetto a quelli elaborati da zero .
Un taglio dell’80% dopo poche settimane non è soltanto una storia di efficienza tecnica. È anche la risposta a un mercato in cui le aspettative sui prezzi stanno cambiando rapidamente.
Il 17 luglio Moonshot AI ha presentato Kimi K3, un modello open-weight da 2,8 trilioni di parametri sviluppato da una startup con sede a Pechino. La società lo ha descritto come il più grande modello open-weight al mondo; Reuters ha riferito che il sistema punta a prestazioni vicine a quelle dei modelli di punta statunitensi .
In alcuni test di programmazione front-end, Kimi K3 ha raggiunto o superato GPT-5.6 Sol e Anthropic Fable 5. Nella classifica Arena Frontend Code ha totalizzato 1.679 punti, davanti a entrambi . Un benchmark indipendente pubblicato il 30 luglio da Startrise AI Labs ha inoltre rilevato un sostanziale pareggio tra Kimi K3 e Claude Opus 5 in un test di ingegneria front-end, con un costo dichiarato di 7,17 dollari per l’intera suite contro i 21,17 dollari di Opus 5 .
Microsoft avrebbe valutato l’integrazione di Kimi K3 in Copilot e Azure. Secondo le ricostruzioni citate, una sostituzione potrebbe far risparmiare fino a 600 milioni di dollari, pari al 60% per token .
Anthropic ha lanciato Claude Opus 5 il 24 luglio con un prezzo di 5 dollari per milione di token in ingresso, la metà del prezzo di Fable 5. Il nuovo modello supera Fable 5 in diversi benchmark, aumentando la pressione proprio nella fascia alta in cui compete GPT-5.6 Sol .
Anche Google e Microsoft hanno presentato a luglio diversi modelli orientati al contenimento dei costi, mettendo sotto pressione soprattutto le fasce intermedia ed economica .
In questo scenario, OpenAI sembra voler usare Luna come modello di riferimento per i carichi di lavoro ad alto volume e sensibili al prezzo, mantenendo Sol come prodotto premium per i compiti più complessi . Terra occupa invece la fascia intermedia, con un equilibrio tra prestazioni e costo.
La riduzione dei prezzi arriva mentre le imprese chiedono strumenti più concreti per evitare che l’utilizzo dell’IA — in particolare quello degli agenti autonomi — faccia crescere le fatture senza controllo.
Il 22 luglio OpenAI ha aggiunto alla propria piattaforma API i limiti mensili rigidi di spesa . A differenza dei precedenti strumenti di monitoraggio, questi limiti possono interrompere effettivamente il traffico: quando il budget mensile configurato viene esaurito, le richieste API successive falliscono con un errore HTTP 429 . Gli amministratori possono impostare il tetto a livello di organizzazione o di singolo progetto; il limite si rinnova all’inizio del ciclo di fatturazione .
La misura risponde a un problema più ampio. Secondo i resoconti disponibili, Amazon e altre grandi aziende stanno introducendo limiti interni o rivolti ai clienti mentre valutano con maggiore attenzione il ritorno sugli investimenti in IA . Reuters descrive un cambiamento nei processi di acquisto: le imprese più attente ai costi stanno gestendo l’IA “come il cloud”, con budget dedicati, assegnazioni plafonate e approvazioni dei responsabili IT per i progetti su larga scala .
Il messaggio per i responsabili finanziari e tecnologici è chiaro: non basta più adottare un modello potente. Bisogna sapere quanto costa ogni flusso di lavoro e poterlo fermare quando raggiunge il limite previsto.
Per sviluppatori e aziende che utilizzano l’API di OpenAI, l’impatto immediato è favorevole:
La conclusione è più ampia del singolo listino: la guerra dei prezzi dell’IA sta accelerando. A spingerla non sono soltanto i nuovi modelli, ma anche l’efficienza dell’infrastruttura — fino al caso, inedito, di un modello che contribuisce a ottimizzare il codice usato per eseguire se stesso — e la crescente prudenza delle imprese. Per gli acquirenti, questo significa prezzi potenzialmente più bassi; per i fornitori, una pressione costante a dimostrare che ogni aumento di capacità porta un valore misurabile.