DeepCybo의 PhysBrain 1.5는 주변 장면을 해석하고, 로봇의 움직임을 생성하며, 그 움직임 뒤의 상태까지 예측하도록 설계된 공개 가중치 모델이다. 주목할 부분은 세 능력을 하나의 모델에 담았다는 점이다. 다만 발표된 성적은 주로 체화 이해 평가 결과다. 로봇이 현실에서 물체를 안정적으로 다뤘다는 증거로 읽어서는 안 된다.
1
9
10
이해·동작·예측을 어떻게 하나로 묶었나
2B와 8B 버전은 각각 대응하는 Qwen3-VL 비전·언어 모델을 바탕으로 한다. PhysBrain 1.5는 장면에 대한 언어·공간 답변, 로봇 말단장치의 움직임, 이후의 시각 상태를 모두 이산적인 토큰 시퀀스로 표현한다. 미래 상태에는 RGB 영상뿐 아니라 깊이와 로봇이 차지하는 영역에 관한 정보도 포함된다. 과제마다 별도의 출력 구조를 두는 대신, 하나의 자기회귀 구조에서 다음 토큰을 예측하도록 학습하는 방식이다.
1
8
10
쉽게 말해 ‘지금 무엇이 보이는가’, ‘어떻게 움직일 것인가’, ‘움직인 뒤 무엇이 보일 것인가’를 같은 생성 방식으로 다룬다. 움직임을 생성하거나 결과를 예측하는 능력과 실제 로봇에서 그 동작을 성공적으로 실행하는 능력은 구분해야 한다.
1
8
사람의 영상만으로 학습했나
아니다. DeepCybo가 설명한 학습은 두 단계다. 먼저 작업 중심의 사람 상호작용 영상을 이용해 장면·작업 맥락을 복원한 움직임 및 이후 관찰 결과와 연결하는 체화 사전학습을 한다. 이어 사람의 시연, 로봇 동작 궤적, 시뮬레이션 경험을 섞은 데이터로 지도 미세조정을 진행한다. 따라서 ‘사람 영상만으로 학습한 모델’이라는 설명은 전체 과정을 정확히 담지 못한다.
1
12
28개 평가의 72.5점은 무엇을 뜻하나
DeepCybo에 따르면 PhysBrain 1.5-8B는 28개 체화 이해 벤치마크 평균 72.5점을 기록했다. 자사가 비교한 공개 모델 가운데 평균이 가장 높았고, 개별 평가 14개에서도 공개 모델 중 최고 성적을 냈다. 2B 버전의 발표 평균은 66.6점이다. 평가 범위는 시각·공간 지각, 3D·다중 시점 이해, 체화 추론·계획, 대상의 위치 파악과 동작 가능성 판단, 시각적 이동 경로 추론을 아우른다.
1
9
10
11
DeepCybo가 공개한 비교표에서 8B 모델의 점수는 비공개 모델인 GPT-6-Astra의 73.3점, Gemini 3.6 Flash의 73.0점과 가깝다. 어디까지나 해당 평가 조건에서의 비교다. 모든 모델을 독립적으로 평가한 종합 순위도, 로봇이 실제 작업을 완료한 비율도 아니다.
1
18
도입 전 무엇을 검증해야 하나
DeepCybo는 2B·8B 체크포인트와 기술 보고서, 평가 자료를 공개했다. 이를 활용하면 팀별로 모델을 살펴보고 발표 결과의 재현을 시도할 수 있다.
1
9
10
11
평균 점수만 보기보다 평가별 성적과 설정, 학습·시험 데이터의 겹침 가능성, 비교 대상 모델에 동등한 조건이 적용됐는지 확인해야 한다. 실제 도입 판단에는 사용할 로봇에서 동작을 실행하고 그 결과를 다시 입력받는 폐루프 시험이 더 중요하다. 실제 물체와 환경에서의 작업 성공률, 실패 후 복구, 지연 시간, 안전성을 따로 측정해야 한다. 체화 이해 점수는 그 시험을 대신할 수 없다.
1
9
10