리플렉션 AI가 2026년 10월 5일 첫 공개 가중치 모델 ‘빔(Beam)’을 발표했다. 코딩과 복잡한 추론, 여러 단계를 거쳐 도구를 사용하는 AI 에이전트 작업을 겨냥한 모델이다. 기업과 공공기관이 AI를 직접 실행하고 조정할 수 있는 선택지를 제공하겠다는 구상으로, 딥시크와 알리바바의 Qwen, Z.ai 등 중국 개발사 모델과 경쟁하는 미국산 대안으로 내세웠다. 다만 이번 발표만으로 빔이 중국 경쟁 모델을 전반적으로 앞섰다고 볼 수는 없다.
4
7
18
전체 5010억 파라미터, 토큰마다 약 230억 개 활성화
빔은 희소 혼합 전문가(Mixture of Experts·MoE) 구조를 사용한다. 모델 전체에는 5010억 개 파라미터가 있지만, 각 토큰을 처리할 때는 그중 약 230억 개만 활성화하는 방식이다. 리플렉션은 모델을 23조 8000억 토큰으로 사전학습했으며, 최대 100만 토큰의 문맥을 처리할 수 있다고 밝혔다.
7
18
회사는 추론 능력을 다듬기 위한 강화학습을 4주간 진행하면서 엔비디아 GB300 GPU 1만 500대를 사용했고, 학습 과정에서 1억 회가 넘는 롤아웃, 즉 과제 수행 시도를 생성했다고 설명했다. 이는 회사가 공개한 학습 수치다.
18
성능·비용 주장은 아직 검증이 필요하다
리플렉션은 고난도 추론 벤치마크에서 빔이 Z.ai의 GLM-5.2와 비슷한 성능을 냈다고 주장했다. 회사가 공개한 점수는 Terminal Bench v2.1에서 80.1점, SWE-Bench Verified에서 80.9점, GPQA Diamond에서 90.5점이다. 또 알리바바의 Qwen 3.8-Max와 Kimi K3, 주요 서구권 공개 모델과도 비교했다. 이 수치와 비교는 회사가 제시한 결과이며, 독립적으로 확정된 순위는 아니다.
3
7
13
리플렉션의 핵심 효율성 주장은 빔이 비슷한 성능을 내는 데 추론 연산량을 3~4배 적게 쓸 수 있다는 것이다. 하지만 이 계산은 근사치이며, 프롬프트를 처음 처리하는 프리필 단계나 실제 서비스 운영에 드는 오버헤드는 포함하지 않는다. TechCrunch도 성능 주장이 독립적으로 검증되지 않았다고 전했다. 따라서 이 수치를 실제 배포에서 확인된 비용 절감으로 받아들이기는 이르다.
7
13
빔의 등장은 미국산 공개 가중치 모델의 새 경쟁자가 나왔다는 의미는 있지만, 현재 공개된 비교 자료만으로 중국 모델을 전반적으로 앞섰다고 결론 내릴 수는 없다.
13
공개 가중치와 ‘AI 공장’ 구상
발표 당시 빔은 최종 레드팀 점검과 평가를 받고 있었다. 리플렉션은 대기자 명단을 통해 일부 사용자에게 먼저 접근 기회를 제공하고, 10월 말 Apache 2.0 라이선스의 모델 가중치와 기술 보고서, 모델 카드, 개발자 자료를 공개할 계획이라고 밝혔다. 당시 공개 가중치는 아직 배포되지 않은 상태였다.
18
25
28
빔은 리플렉션이 내세우는 더 큰 ‘AI 공장’ 구상과도 연결된다. 기관이 자체 데이터를 활용해 비용을 낮춘 AI 시스템을 만들고 운영하도록 돕겠다는 방향이다. 미 에너지부의 제네시스 미션을 지원하고, 미국 국립연구소 17곳에 서비스를 제공하는 일과 네비우스·스페이스X의 엔비디아 서버 임대 계약은 이 전략의 일부로 거론됐다. 다만 CEO 미샤 라스킨은 최첨단 역량에 도달하기까지 시간이 걸릴 것이라고 신중한 입장을 밝혔다.
3
4
13
가중치와 기술 자료가 공개되면 개발자들은 빔을 직접 실행하고, 비용과 성능을 경쟁 모델과 비교해 볼 수 있다. 그 전까지는 실제 배포 성능과 운영 비용, 경쟁 모델 대비 위치가 확인되지 않은 과제로 남는다.