Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility
- 발행일
- 출처
- arXiv
- 논문 번호
- 881
- 분야
- Robotics
- arXiv 번호
- 2608.10860
이 논문은 로봇 정책 모델이 RGB 영상뿐 아니라 3D 깊이와 객체 의미 정보도 함께 예측하도록 학습해서, 더 적은 데이터로 더 정확하게 로봇을 제어하는 방법을 제안한다.
이 논문은 한마디로 로봇이 미래를 예측할 때 단순히 RGB 영상만 예측하는 게 아니라 3D 구조와 객체 정보까지 함께 예측하게 만들면 성능이 크게 올라간다는 것을 보여준다. Flex-π는 60억 파라미터 세계-행동 모델(WAM)로, 비디오 생성 모델의 VAE가 RGB뿐 아니라 3D 포인트맵까지 거의 손실 없이 인코딩한다는 발견을 활용한다. 학습 시 RGB·3D·객체 의미를 함께 예측하고, 추론 시에는 원하는 조합만 선택해 속도와 성능을 조절할 수 있다. 실제 로봇 작업에서 기존 최강 baseline 대비 2~7배 높은 성공률을 기록했다.
핵심 요약
- 비디오 생성 모델의 VAE가 RGB뿐 아니라 3D 포인트맵도 거의 손실 없이 인코딩한다는 '공짜 점심'을 발견했다.
- RGB, 3D 깊이, DINO 객체 특징을 공유 잠재 공간에서 함께 예측하는 다중 스트림 세계-행동 모델을 구축했다.
- 학습 시 무작위로 모달리티를 빼서('스트림 드롭아웃') 하나의 체크포인트가 추론 시 어떤 조합에서도 작동하게 했다.
- 로봇 작업(RoboTwin)에서 적은 데이터(50 demo)일 때 기존 WAM 대비 1.9배, 실제 양팔 로봇에서 2~7배 성공률을 기록했다.
- action-only 모드에서 π0.5보다 빠르면서도 더 높은 성공률을 달성했다 (약 60ms).
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.