Reflection AI hat Beam am 5. Oktober 2026 als sein erstes Open-Weight-Modell vorgestellt. Das reine Textmodell ist auf Programmierung, logisches Schlussfolgern und KI-Agenten ausgelegt – also auf Systeme, die mehrstufige Aufgaben bearbeiten und Werkzeuge nutzen können. Reflection positioniert Beam als Alternative zu führenden offenen Modellen aus China und dem Westen. Die Leistungs- und Effizienzvergleiche stammen bislang jedoch vom Unternehmen selbst: Ohne veröffentlichte Gewichte können unabhängige Tester sie noch nicht nachvollziehen.
3
7
13
Was über Beam bekannt ist
Beam nutzt eine sogenannte Sparse Mixture-of-Experts-Architektur. Das Modell umfasst insgesamt 501 Milliarden Parameter, aktiviert laut Reflection aber jeweils etwa 23 Milliarden pro verarbeitetem Token. Das Unternehmen gibt an, Beam mit 23,8 Billionen Tokens vortrainiert und anschließend mit rechenintensivem Reinforcement Learning weiterentwickelt zu haben. Dieser Trainingslauf habe mehr als 100 Millionen sogenannte Rollouts erzeugt – Durchläufe, in denen das Modell mögliche Lösungswege erprobt.
14
Reflection nennt ein Kontextfenster von bis zu einer Million Tokens. Bei einem frühen Beta-Zugang wird dagegen von einer Grenze von 256.000 Tokens berichtet. Modellangabe und tatsächlich verfügbare Grenze eines bestimmten Dienstes können also voneinander abweichen. Aus den vorliegenden Informationen geht nicht hervor, ob das Beta-Limit für jede Bereitstellung gilt.
3
7
17
18
Was die Benchmark-Zahlen aussagen – und was nicht
Reflection meldet für Beam 80,9 Prozent bei SWE-bench Verified, einem Test für Programmieraufgaben. In einem weiteren Vergleich auf Terminal-Bench v2.1 erreicht Beam laut den veröffentlichten Zahlen 80,1 Punkte. Das liegt unter GLM-5.2 mit 81,0 sowie Kimi K3 mit 88,3 und DeepSeek V4.1 Flash mit 90,6. Die Ergebnisse deuten darauf hin, dass Beam bei bestimmten Aufgaben konkurrenzfähig sein könnte. Sie belegen aber nicht, dass das Modell führende offene Modelle aus China oder dem Westen insgesamt übertrifft.
12
20
Reflection zufolge erreicht Beam bei ausgewählten Tests ein ähnliches Niveau wie GLM-5.2 beim logischen Schlussfolgern. Außerdem schätzt das Unternehmen, dass Beam für die Textgenerierung etwa drei- bis viermal weniger Rechenaufwand benötigt als GLM-5.2 und mehr als viermal weniger als führende westliche Open-Weight-Modelle in den eigenen Vergleichen. Das sind Unternehmensschätzungen – keine unabhängigen Messungen, die für jeden Einsatz dieselbe Senkung von Kosten oder Antwortzeit belegen.
13
16
Solange die Gewichte nicht öffentlich sind, lassen sich die Benchmarks und Rechenvergleiche nicht unabhängig reproduzieren. Auch Unterschiede beim Testaufbau und bei den Bedingungen, unter denen ein Modell betrieben wird, können Vergleiche beeinflussen. Die gemeldeten Werte sagen daher noch nicht zuverlässig voraus, wie Beam bei anderen Aufgaben oder in einer konkreten Anwendung abschneidet.
7
13
Veröffentlichung und Zugang
Reflection plant, die Gewichte später im Oktober 2026 unter der Apache-2.0-Lizenz zu veröffentlichen. Ein genaues Datum nennen die verfügbaren Quellen nicht. Open-Weight bedeutet, dass die trainierten Modellparameter zugänglich werden sollen; daraus folgt nicht automatisch, dass auch sämtliche Trainingsdaten oder Entwicklungsdetails veröffentlicht werden. Berichten zufolge plant Reflection außerdem unterstützende Materialien wie einen technischen Bericht und eine Model Card. Bis diese erscheinen, bleibt der genaue Umfang der Veröffentlichung offen.
2
3
21
Bis dahin können Interessierte über eine Warteliste Zugang zu einer frühen Version anfragen. Mit veröffentlichten Gewichten könnten Entwickler das Modell auf eigener Hardware betreiben und anpassen. Das ist jedoch nicht gleichbedeutend mit einem unabhängig geprüften, sofort einsatzbereiten System für jede Organisation. Reflection richtet sich mit Beam an Entwickler, Unternehmen und den öffentlichen Sektor; die verfügbaren Berichte belegen weder einen konkreten Einsatz bei einer Behörde noch ein Modell, das nachweislich mit den privaten Daten einer Institution angepasst wurde.
1
5
31
Ein Modellstart mit großem Infrastrukturbedarf
Beam ist Teil einer größeren Infrastrukturstrategie. Berichten zufolge hat Reflection eine Vereinbarung im Wert von 6,3 Milliarden US-Dollar mit SpaceX geschlossen, die Nvidia-GB300-Systeme umfasst; hinzu kommt eine separate Rechenkapazitätsvereinbarung mit Nebius. Diese Abkommen geben einen Eindruck von der Größenordnung der Infrastruktur hinter den Ambitionen des Unternehmens. Sie bestätigen aber nicht unabhängig die Leistungswerte von Beam oder die versprochenen Einsparungen beim Betrieb.
4
8
Für eine faire Einschätzung lohnt es sich deshalb, angekündigte Spezifikationen und noch ungeprüfte Vergleiche auseinanderzuhalten: Architektur, Trainingsumfang und Zielaufgaben hat Reflection beschrieben. Wie Beam im direkten Vergleich abschneidet und wie effizient es sich im Alltag betreiben lässt, wird sich erst mit der Veröffentlichung der Gewichte und ausführlicherer Evaluationsunterlagen besser beurteilen lassen.
7
13
14