리플렉션 AI는 2026년 10월 5일 첫 오픈 웨이트 모델 ‘빔(Beam)’을 발표했다. 텍스트 전용 모델인 빔은 코딩과 추론, AI 에이전트 작업을 겨냥하며, 회사는 중국과 서방의 주요 오픈 모델에 맞설 대안으로 내세우고 있다. 다만 성능과 연산 효율에 관한 비교는 가중치가 공개돼 독립 검증을 거치기 전까지 회사 측 주장으로 봐야 한다.
3
7
13
5010억 개 매개변수, 토큰당 약 230억 개 활성화
빔은 ‘희소 혼합 전문가(Mixture-of-Experts·MoE)’ 구조를 채택했다. 전체 매개변수는 5010억 개지만, 토큰을 처리할 때는 약 230억 개가 활성화된다는 설명이다. 리플렉션 AI는 23조 8000억 개의 토큰으로 사전학습한 뒤 대규모 연산을 활용한 강화학습을 진행했으며, 이 과정에서 1억 회가 넘는 롤아웃을 생성했다고 밝혔다.
14
회사가 제시한 최대 컨텍스트 길이는 100만 토큰이다. 다만 베타 인터페이스를 다룬 외부 보도에는 25만 6000토큰 제한이 언급돼 있다. 모델의 발표 사양과 특정 서비스에서 당장 사용할 수 있는 한도가 다를 수 있다는 뜻이다. 현재 자료만으로는 이 베타 제한이 모든 배포 환경에 적용된다고 볼 수 없다.
3
7
17
18
벤치마크 점수와 비교에서 볼 점
리플렉션 AI는 빔이 SWE-bench Verified에서 80.9%를 기록했다고 밝혔다. 명령줄 작업 능력을 평가하는 Terminal-Bench v2.1에서는 빔 점수가 80.1로 집계됐다. 비교 자료에 나온 GLM-5.2는 81.0, Kimi K3는 88.3, DeepSeek V4.1 Flash는 90.6이었다. 빔이 일부 작업에서 경쟁력을 보일 가능성은 있지만, 이 수치만으로 중국이나 서방의 주요 오픈 모델 전반을 앞선다고 보기는 어렵다.
12
20
회사는 일부 벤치마크에서 빔의 추론 성능이 GLM-5.2급이라고 설명했다. 또 자체 비교에서 빔의 추론 시 추정 생성 연산량이 GLM-5.2보다 약 3~4배 적고, 주요 서방 오픈 모델보다 4배 넘게 적다고 주장한다. 이는 추정치이며, 실제 서비스에서 모든 이용자가 같은 비용 절감이나 응답 속도 향상을 얻는다는 독립 측정 결과는 아니다.
13
16
아직 가중치가 공개되지 않아 외부 평가자가 같은 조건에서 결과를 재현하기 어렵다. 평가 방식이나 서비스 환경이 달라지면 모델 간 비교도 달라질 수 있다. 따라서 현재 공개된 수치만으로는 다른 작업이나 실제 배포 환경에서의 성능까지 단정하기 어렵다.
7
13
가중치 공개와 현재 이용 방법
리플렉션 AI는 빔의 가중치를 2026년 10월 중 Apache 2.0 라이선스로 공개할 계획이지만, 정확한 날짜는 밝히지 않았다. 조기 접근은 대기자 명단을 통해 신청할 수 있다. 기술 보고서와 모델 카드 등 보조 자료도 공개될 예정으로 보도됐지만, 해당 자료가 나오기 전까지 공개 범위와 세부 평가 내용을 확정하기는 어렵다.
2
3
21
오픈 웨이트 모델은 가중치를 내려받아 직접 실행하거나 수정할 수 있다는 점에서 개발자와 기관에 선택지를 제공한다. 그렇다고 특정 조직에서 바로 쓸 수 있는 시스템으로 검증됐다는 의미는 아니다. 빔은 개발자와 기업, 공공 부문을 대상으로 소개됐지만, 현재 공개된 출시 보도만으로는 특정 기관의 실제 도입이나 해당 기관의 비공개 데이터로 맞춤화된 모델이 확인된 것은 아니다.
1
5
31
대규모 인프라 투자와 빔의 의미
빔 발표는 리플렉션 AI의 대규모 인프라 투자와 맞물려 있다. 보도에 따르면 회사는 엔비디아 GB300 시스템을 활용하는 스페이스X와 63억 달러 규모의 계약을 맺었으며, 네비우스와도 별도의 컴퓨팅 계약을 체결했다. 이런 계약은 회사가 추진하는 사업의 인프라 규모를 보여주지만, 빔의 성능이나 추론 비용 절감 주장을 독립적으로 입증하지는 않는다.
4
8
현재 확인 가능한 사실은 모델의 구조와 학습 규모, 목표 작업, 공개 계획이다. 반면 경쟁 모델 대비 성능과 실제 운영 효율은 가중치와 상세 평가 자료가 공개된 뒤 검증해야 할 주장으로 남아 있다.
7
13
14