ActiveMimic: Egocentric Video Pretraining with Active Perception

발행일
출처
arXiv
논문 번호
359
분야
Robotics
arXiv 번호
2606.06194

에고센트릭 인간 영상에서 인간의 시점 재배치(active perception)를 모델링하여 로봇 조작으로 전이하는 사전학습 프레임워크다. 로봇 데이터 기반 SOTA와 동등한 성능을 달성하며, active perception이 에고센트릭 사전학습에서 기원함을 실증한다.

기존 에고센트릭 영상 기반 로봇 사전학습은 로봇 데이터 기반 모델에 미치지 못했는데, 본 논문은 이 격차의 원인이 인간의 시점 재배치(active perception) 신호 누락임을 밝힌다. ActiveMimic은 단일 body-worn RGB 카메라에서 VGGT와 SAM-3D-Body를 활용해 카메라·손목 궤적을 복원하고, 카메라-손목 커플링을 해결하여 27차원(카메라 9D + 양손 각 9D) 통합 행동 표현을 구축한다. Ego4D에서 flow matching으로 능동 지각과 조작을 동시 학습한 후 타겟 로봇에 적응한다. 4개 실제 로봇 과제에서 로봇 데이터 기반 π0와 동등하거나 우월한 성공률(Restocking 90.1%, Finding 91.7%)을 달성했다.

핵심 요약

  • 에고센트릭 영상의 카메라 모션을 noise가 아닌 viewpoint action으로 재해석
  • VGGT + SAM-3D-Body로 단일 RGB에서 카메라·손목 궤적 복원, 27차원 통합 행동 표현 구축
  • Ego4D 대규모 데이터셋에서 flow matching으로 active perception과 조작 동시 학습
  • 실제 로봇 4과제 평가: Restocking 90.1%, Finding 91.7% 등 π0 대비 동등 또는 우월
  • Active perception 능력이 로봇 fine-tuning이 아닌 에고센트릭 사전학습에서 기원함을 실증
  • 카메라 모션 supervision이 인간→로봇 표현 전이를 촉진함을 layer-level 분석으로 확인

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)