로봇이 카메라 영상을 받아 다음 동작을 결정할 때는 모델의 판단이 늦어지는 만큼 행동 출력도 늦어진다. APXInf는 이 추론 단계를 로봇 가까이에서 실행하도록 만든 오픈소스 엔진이다. 인피니전스 AI(Infinigence AI)가 칭화대·상하이교통대와 함께 공개했다. 로봇의 모터를 직접 제어하는 장치라기보다, 관측값을 모델에 넣어 행동을 생성하는 과정의 지연을 줄이는 소프트웨어에 가깝다.
14
4
Rust로 실행하고, Python으로 연결한다
APXInf의 경량 Rust 런타임은 실행과 메모리·자원 관리를 맡고, Python 인터페이스는 개발자가 기존 로봇 소프트웨어에서 정책 모델을 호출할 수 있게 한다. 모델을 이식할 때는 기준 체크포인트와 테스트 입력을 고정한 뒤, 이식한 모델의 출력과 중간 계산값을 원본과 대조하고 최적화하는 흐름을 제시한다. 속도를 높이기 전에 같은 모델이 같은 결과를 내는지 확인하려는 절차다.
3
5
최적화는 한 가지 기법에 기대지 않는다. 파이프라인은 추론 경로 전반의 대기 시간을 줄이고, 그래프 캡처와 버퍼 재사용은 반복 실행 때의 준비 작업을 덜어준다. 여기에 비용이 큰 연산을 위한 GPU 커널 최적화, 연산량과 메모리 이동을 줄일 수 있는 FP8·INT8 양자화를 결합한다. 목표는 로봇에서 행동을 생성하는 시간을 짧고 예측 가능하게 만드는 것이다.
8
5
‘278ms → 26ms 미만’은 어떤 수치인가
발표 자료의 비교 대상은 Jetson Thor에서 FP8 정밀도로 실행한 π0.5다. 이 조건에서 최적화 전 기준 추론 지연 278ms가 26ms 미만으로 줄었고, 초당 추론 횟수는 38.46회로 제시됐다. 278ms를 단순 환산하면 초당 약 3.6회이므로, 발표된 지연 감소 폭은 약 10.7배다. 여기서 38.46Hz는 모델 추론 빈도이지, 카메라 입력부터 모터 구동까지 포함한 모든 로봇의 제어 주기가 38.46Hz라는 뜻은 아니다. 일부 보도에는 46Hz도 등장하지만, 26ms와 일치하는 수치는 약 38.46Hz다.
8
6
수치를 읽을 때는 공개 자료 사이의 차이도 봐야 한다. APXInf 저장소의 별도 성능표는 Jetson AGX Thor의 FP8 결과를 41.16ms·24.3Hz로 기재한다. 따라서 ‘26ms 미만’을 Thor에서 언제나 재현되는 단일 성능값으로 받아들여서는 안 된다. 체크포인트, 정밀도, 장치, 측정 조건을 맞춰 다시 확인해야 한다.
5
8
어디까지 쓸 수 있고, 무엇이 계획 단계인가
초기 공개 범위로 소개된 모델은 π0.5와 WALL-OSS, 하드웨어는 RTX 4090·Jetson Orin·Jetson Thor다. 저장소는 특히 Thor·Orin에서 최적화한 첫 π0.5 경로와 BF16·FP8·INT8 옵션을 설명한다. APXInf는 RLinf 생태계에서 학습 이후의 추론·배포 쪽에 해당하며, 로봇용 패키지에는 OpenPI와 호환되는 WebSocket 서버 인터페이스도 있다. 다만 서버 인터페이스의 호환성은 모든 OpenPI 체크포인트가 이미 APXInf로 이식됐다는 의미가 아니다.
4
5
1
향후 계획에는 더 많은 시각·언어·행동 모델(VLA), 시각·언어 모델(VLM), 월드 모델과 추가 하드웨어 백엔드가 포함된다. Qwen과 GR00T는 적응 작업 대상으로 언급됐지만, 계획을 현재 지원 목록으로 읽어서는 안 된다. 무엇보다 특정 Thor 벤치마크의 추론 속도만으로 다른 모델이나 전력 제한이 다른 로봇의 지속 성능, 실제 작업 성공률까지 판단할 수는 없다.
9
5