Flex-$π$: A Multi-Stream World-Action Model with Compute Flexibility

발행일
출처
arXiv
논문 번호
881
분야
Robotics
arXiv 번호
2608.10860

이 논문은 로봇 정책 모델이 RGB 영상뿐 아니라 3D 깊이와 객체 의미 정보도 함께 예측하도록 학습해서, 더 적은 데이터로 더 정확하게 로봇을 제어하는 방법을 제안한다.

이 논문은 한마디로 로봇이 미래를 예측할 때 단순히 RGB 영상만 예측하는 게 아니라 3D 구조와 객체 정보까지 함께 예측하게 만들면 성능이 크게 올라간다는 것을 보여준다. Flex-π는 60억 파라미터 세계-행동 모델(WAM)로, 비디오 생성 모델의 VAE가 RGB뿐 아니라 3D 포인트맵까지 거의 손실 없이 인코딩한다는 발견을 활용한다. 학습 시 RGB·3D·객체 의미를 함께 예측하고, 추론 시에는 원하는 조합만 선택해 속도와 성능을 조절할 수 있다. 실제 로봇 작업에서 기존 최강 baseline 대비 2~7배 높은 성공률을 기록했다.

핵심 요약

  • 비디오 생성 모델의 VAE가 RGB뿐 아니라 3D 포인트맵도 거의 손실 없이 인코딩한다는 '공짜 점심'을 발견했다.
  • RGB, 3D 깊이, DINO 객체 특징을 공유 잠재 공간에서 함께 예측하는 다중 스트림 세계-행동 모델을 구축했다.
  • 학습 시 무작위로 모달리티를 빼서('스트림 드롭아웃') 하나의 체크포인트가 추론 시 어떤 조합에서도 작동하게 했다.
  • 로봇 작업(RoboTwin)에서 적은 데이터(50 demo)일 때 기존 WAM 대비 1.9배, 실제 양팔 로봇에서 2~7배 성공률을 기록했다.
  • action-only 모드에서 π0.5보다 빠르면서도 더 높은 성공률을 달성했다 (약 60ms).

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)