A Reflection AI anunciou o Beam em 5 de outubro de 2026 como seu primeiro modelo de pesos abertos. O sistema, baseado em texto, foi desenvolvido para programação, raciocínio e tarefas com agentes de IA. A empresa o apresenta como uma alternativa a modelos abertos de ponta da China e do Ocidente, mas as comparações de desempenho e eficiência ainda são afirmações da própria Reflection: os pesos e os detalhes completos das avaliações não estão disponíveis para verificação independente.
3
7
13
Arquitetura, treinamento e janela de contexto
O Beam usa uma arquitetura esparsa de mistura de especialistas (Mixture of Experts, ou MoE): são 501 bilhões de parâmetros no total, mas cerca de 23 bilhões ficam ativos para cada token processado. A Reflection diz ter pré-treinado o modelo com 23,8 trilhões de tokens e, depois, realizado um treinamento por reforço de alta computação. Segundo o anúncio da empresa, essa etapa gerou mais de 100 milhões de tentativas de execução, ou rollouts.
14
A Reflection informa que o modelo pode ter uma janela de contexto de até 1 milhão de tokens. Há, porém, uma diferença entre essa especificação anunciada e o acesso disponível: relatos sobre a interface beta de terceiros indicam um limite de 256 mil tokens. Portanto, a capacidade anunciada para o modelo e o limite oferecido por um serviço específico podem não ser iguais; as informações disponíveis não mostram que o limite da versão beta se aplique a todas as formas de uso.
3
7
17
18
O que mostram as comparações de benchmark
A Reflection divulgou uma pontuação de 80,9% no SWE-bench Verified. Em outra comparação reportada, no Terminal-Bench v2.1, o Beam marcou 80,1, abaixo do GLM-5.2, com 81,0, do Kimi K3, com 88,3, e do DeepSeek V4.1 Flash, com 90,6. Os números sugerem que o Beam pode ser competitivo em algumas tarefas, mas não sustentam uma afirmação ampla de que supera os principais modelos abertos chineses ou ocidentais.
12
20
A empresa também afirma que o Beam alcança resultados de raciocínio comparáveis aos do GLM-5.2 em benchmarks selecionados. Segundo suas estimativas, o modelo usa cerca de três a quatro vezes menos computação na geração de respostas do que o GLM-5.2 e mais de quatro vezes menos do que modelos abertos ocidentais de ponta incluídos na comparação. São estimativas da empresa, não medições independentes que garantam a mesma redução de custo ou latência para todos os usuários.
13
16
Como os pesos ainda não foram disponibilizados para testes independentes, é melhor tratar os resultados e as comparações de computação como preliminares. Diferenças nas condições de avaliação e de execução podem afetar a comparação entre modelos; os números divulgados, por si só, não demonstram como o Beam se sairá em outras tarefas ou em diferentes ambientes.
7
13
Lançamento e acesso
A Reflection planeja publicar os pesos do Beam sob a licença Apache 2.0 ainda em outubro de 2026, mas as fontes disponíveis não indicam uma data exata. Há acesso antecipado por lista de espera. Também foram mencionados materiais complementares, como um relatório técnico e um cartão do modelo; até a publicação desses documentos, ainda não está claro o que estará incluído no lançamento.
2
3
21
Pesos abertos permitem que desenvolvedores baixem e adaptem o modelo publicado. Isso, porém, não significa que o sistema já esteja verificado e pronto para uso em qualquer organização. O Beam é voltado a desenvolvedores, empresas e órgãos públicos, mas as informações disponíveis sobre o lançamento não confirmam a implantação em uma agência específica nem a adaptação do modelo com dados privados de uma instituição.
1
5
31
Como o Beam se encaixa na estratégia da Reflection AI
O lançamento do modelo vem acompanhado de uma aposta em infraestrutura de grande porte. Reportagens descrevem um acordo de US$ 6,3 bilhões com a SpaceX, envolvendo sistemas Nvidia GB300, além de um contrato separado de computação com a Nebius. Esses acordos dão uma ideia da escala da infraestrutura ligada às ambições da Reflection, mas não comprovam, por si só, o desempenho do Beam nem a economia estimada no uso do modelo.
4
8
Por enquanto, a avaliação mais clara é separar as especificações divulgadas das comparações ainda não verificadas: a Reflection anunciou a arquitetura, a escala do treinamento e os usos pretendidos; já o desempenho relativo em benchmarks e a eficiência no mundo real ainda dependem de testes, da publicação dos pesos e de informações mais completas sobre as avaliações.
7
13
14