One Policy, Many Embodiments: Unified Camera-Centric Action Geometry Pre-training for Heterogeneous Embodied Manipulation

발행일
출처
arXiv
논문 번호
1022
분야
Robotics
arXiv 번호
2608.26058

로봇팔·양팔·휴머노이드·사람 손을 '카메라 좌표계의 움직임' 하나로 통일해 6,300시간 데이터를 한 정책으로 함께 학습한 논문.

이 논문은 한마디로 서로 다른 로봇 몸체의 데이터를 '카메라에 보이는 손목 움직임'이라는 공통 기하로 바꿔 하나의 정책으로 학습했다. 로봇별 제어 명령이 제각각이라 섞어 쓰기 어려웠던 문제를, 카메라 좌표계의 앵커(손목·파지점) 궤적으로 통일하고 각 로봇에 맞는 변환기가 실행 명령으로 바꿔준다. 6,300시간(로봇·시뮬레이션 4,030 + 사람 시연 2,340)을 학습한 단일 체크포인트가 LIBERO 98.3%, RoboTwin 89%대를 찍었다. 사람 손 영상도 별도 변환 없이 하나의 '몸체'로 취급해 그대로 학습에 쓸 수 있다.

핵심 요약

  • 로봇·시뮬레이션·사람 손 데이터를 하나의 카메라 중심 동작 공간으로 정렬해 통합 사전학습했다.
  • 사람 시연 2,340시간을 리타게팅·영상 합성 없이 '인간이라는 몸체'로 직접 학습에 넣었다.
  • 단일 체크포인트로 LIBERO 98.3%, RoboTwin Easy/Hard 88.7%/89.2%, LIBERO-Plus 제로샷 82.0%를 달성했다.
  • 실제 로봇에서 빵 집기 60%·서랍 열기 90%·그릇 쌓기 75%로 같은 조건의 pi0.5(20/85/65%)를 이겼다.
  • 카메라 보정·깊이 추정 오차가 그대로 전파되고 몸체 간 이전(ALOHA에서 ARX 35%)은 여전히 어렵다는 한계도 밝혔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)