Reflection AI ha presentato Beam il 5 ottobre 2026: è il primo modello open-weight dell’azienda, progettato per lavorare su programmazione, ragionamento e attività svolte da agenti di intelligenza artificiale. Reflection lo propone come alternativa ai principali modelli aperti cinesi e occidentali. Le prestazioni e i vantaggi di efficienza annunciati, però, vanno considerati dichiarazioni dell’azienda finché i pesi e i dettagli delle valutazioni non saranno disponibili per verifiche indipendenti.
3
7
13
Architettura, addestramento e contesto
Beam usa un’architettura sparse mixture-of-experts (MoE): conta 501 miliardi di parametri complessivi, ma ne attiva circa 23 miliardi per ciascun token. Reflection dichiara di averlo preaddestrato su 23.800 miliardi di token e di aver poi utilizzato una fase di reinforcement learning ad alta intensità di calcolo. Secondo l’annuncio, questa fase ha generato oltre 100 milioni di roll-out, cioè esecuzioni di addestramento usate per valutare e migliorare le risposte del modello.
14
L’azienda indica una finestra di contesto fino a un milione di token. C’è tuttavia una differenza da tenere presente: alcune ricostruzioni dell’interfaccia beta di terze parti riportano un limite di 256.000 token. Il contesto dichiarato per il modello e quello accessibile tramite uno specifico servizio potrebbero quindi non coincidere; le informazioni disponibili non dimostrano che il limite della beta valga per ogni modalità di utilizzo.
3
7
17
18
Benchmark: i risultati dichiarati e il confronto
Reflection riporta un punteggio dell’80,9% su SWE-bench Verified. In un confronto distinto su Terminal-Bench v2.1, Beam ottiene 80,1: meno di GLM-5.2, a 81,0, Kimi K3, a 88,3, e DeepSeek V4.1 Flash, a 90,6. I numeri indicano che Beam potrebbe essere competitivo in alcune prove, ma non dimostrano che superi in generale i principali modelli open cinesi o occidentali.
12
20
Reflection afferma inoltre che, in alcuni benchmark selezionati, il ragionamento di Beam è paragonabile a quello di GLM-5.2. L’azienda stima che il calcolo necessario per generare le risposte sia circa tre o quattro volte inferiore rispetto a GLM-5.2 e oltre quattro volte inferiore rispetto ai principali modelli open occidentali inclusi nei suoi confronti. Si tratta di stime, non di misurazioni indipendenti che garantiscano a tutti gli utenti gli stessi risparmi di costo o di latenza.
13
16
Senza i pesi pubblici non è ancora possibile ripetere le prove in modo indipendente. Inoltre, le modalità di valutazione e le condizioni di esecuzione possono influenzare il confronto: i punteggi riportati non bastano a stabilire come Beam si comporterà su altri compiti o in ambienti diversi.
7
13
Rilascio e accesso
Reflection prevede di pubblicare i pesi di Beam con licenza Apache 2.0 più avanti nell’ottobre 2026, ma le fonti disponibili non indicano una data precisa. L’azienda ha anche annunciato materiali di supporto, tra cui un rapporto tecnico e una scheda del modello; finché non saranno pubblicati, non è chiaro nel dettaglio cosa comprenderà il rilascio. Per ora, è possibile richiedere l’accesso anticipato tramite una lista d’attesa.
2
3
21
Con i pesi aperti, gli sviluppatori possono scaricare il modello e adattarlo o eseguirlo sui propri sistemi. Questo, però, non equivale a disporre già di una soluzione pronta e verificata per ogni organizzazione. Beam è rivolto a sviluppatori, imprese e clienti del settore pubblico; le informazioni sul lancio non documentano una specifica implementazione presso un ente né un modello personalizzato sui dati privati di un’istituzione.
1
5
31
La strategia di Reflection AI
Il lancio di Beam è accompagnato da un investimento significativo nell’infrastruttura. Le ricostruzioni disponibili riferiscono di un accordo da 6,3 miliardi di dollari con SpaceX, relativo a sistemi Nvidia GB300, e di un’intesa separata per la capacità di calcolo con Nebius. Questi accordi danno un’indicazione della scala delle ambizioni di Reflection, ma non verificano da soli le prestazioni di Beam né i risparmi di calcolo stimati dall’azienda.
4
8
Per il momento conviene distinguere tra specifiche annunciate e confronti ancora da verificare: architettura, dimensioni dell’addestramento e ambiti d’uso sono stati presentati; il posizionamento nei benchmark e l’efficienza nell’uso reale dovranno essere messi alla prova quando saranno disponibili i pesi e materiali di valutazione più completi.
7
13
14