Reflection AI julkisti 5. lokakuuta 2026 Beamin, ensimmäisen avoimien painojen mallinsa. Yhtiö suuntaa sen koodaukseen, vaativaan päättelyyn ja tekoälyagenttien tehtäviin – eli tilanteisiin, joissa malli voi käyttää työkaluja ja edetä tulokseen useassa vaiheessa. Beam on tarkoitettu myös yrityksille ja julkisille organisaatioille, jotka haluavat enemmän mahdollisuuksia ajaa ja mukauttaa tekoälyä itse.
4
5
18
Julkistus asettaa Beamin kilpailemaan muun muassa kiinalaisten DeepSeekin, Alibaban Qwen-tiimin ja Z.ai:n mallien kanssa. Tämä ei kuitenkaan vielä osoita, että Beam olisi kokonaisuutena kilpailijoitaan parempi: suorituskykyvertailut ovat toistaiseksi Reflectionin omia väitteitä.
4
7
13
Mallissa on 501 miljardia parametria, mutta vain osa aktivoituu kerralla
Beam käyttää harvaa asiantuntijaseosarkkitehtuuria (Mixture of Experts). Siinä kaikkia mallin osia ei käytetä jokaiseen käsiteltävään tokeniin: Reflectionin mukaan mallissa on yhteensä 501 miljardia parametria, mutta niistä noin 23 miljardia aktivoituu kerrallaan. Yhtiö kertoo esikouluttaneensa mallia 23,8 biljoonalla tokenilla ja ilmoittaa konteksti-ikkunan yltävän enintään miljoonaan tokeniin.
7
18
Reflectionin mukaan neljän viikon vahvistusoppimisajossa käytettiin 10 500:aa Nvidia GB300 -grafiikkasuoritinta. Ajon aikana kertyi yli 100 miljoonaa roll-outia eli mallin tekemää tehtävän suoritusyritystä. Nämä ovat yhtiön ilmoittamia koulutustietoja.
18
Vertailuluvut ovat vielä yhtiön omia tuloksia
Reflection kertoo Beamin saaneen edistyneen päättelyn vertailutesteissä tuloksia, jotka vastaavat Z.ai:n GLM-5.2-mallin tasoa. Yhtiö ilmoittaa pisteiksi 80,1 Terminal Bench v2.1 -testissä, 80,9 SWE-Bench Verified -testissä ja 90,5 GPQA Diamond -testissä. Se vertaa mallia myös Alibaba Qwen 3.8-Maxiin, Kimi K3:een ja länsimaisiin avoimien painojen malleihin. Lukuja ja vertailuja on kuitenkin syytä pitää yhtiön ilmoittamina, ei riippumattomasti vahvistettuina paremmuusjärjestyksinä.
3
7
13
Reflectionin näyttävin tehokkuusväite on, että Beam saavuttaa vertailukelpoisen suorituskyvyn 3–4 kertaa pienemmällä inferenssilaskennan määrällä. Arvio on suuntaa-antava, eikä siihen sisälly kehotteen esikäsittelyyn tai mallin tarjoamiseen liittyvää laskentaa ja kuormaa. TechCrunchin mukaan suorituskykyväitteitä ei ollut riippumattomasti varmennettu. Siksi laskentaetua ei pidä vielä tulkita todisteeksi pienemmistä todellisista käyttökustannuksista: vertailu vaatii riippumattomia testejä ja keskenään vertailukelpoiset käyttöolosuhteet.
7
13
Painot oli määrä julkaista myöhemmin lokakuussa
Julkistushetkellä Beam oli vielä lopullisessa red team -turvallisuustestauksessa ja arvioinnissa. Reflection kertoi valittujen käyttäjien voivan hakea ennakkopääsyä jonotuslistan kautta. Yhtiön suunnitelmana oli julkaista mallin painot Apache 2.0 -lisenssillä myöhemmin lokakuussa teknisen raportin, mallikortin ja kehittäjämateriaalien kanssa. Julkinen painojulkaisu oli siis julkistushetkellä vasta suunnitteilla.
18
25
28
Kun painot ja dokumentaatio ovat saatavilla, kehittäjät voivat arvioida mallia käytännössä aiempaa suoremmin. Siihen asti Beamin todellinen suorituskyky, käyttöönoton kustannukset ja asema kilpailijoihin nähden ovat vielä avoimia kysymyksiä.