Ego2Robot: Scalable Robot Data Synthesis from Egocentric Human Data

발행일
출처
arXiv
논문 번호
793
분야
Robotics
arXiv 번호
2608.02580

사람 1인칭 시점 손 조작 영상을 로봇 학습 데이터로 자동 변환하는 파이프라인 Ego2Robot을 만들었다. 15개 로봇 형태용 18,561시간 합성 데이터로 VLA(영상과 지시문을 받아 로봇 동작을 내놓는 모델)를 사전학습하면 처음 보는 조건에서 성능이 좋아짐을 보였다.

로봇 조작 정책을 일반화시키려면 대규모 다양한 시연 데이터가 필요하지만 로봇 원격조작 수집은 비싸고 하드웨어에 묶여 있다. 저자들은 에고센트릭(1인칭 시점) 사람 손 조작 영상을 동작 정렬, 시각 정렬, 다단계 품질 선별을 거쳐 로봇 포맷 데이터로 바꾸는 Ego2Robot 파이프라인을 제안했다. 네 개 출처 약 1,940시간 영상에서 15개 로봇 형태용 18,561시간 학습 데이터를 만들었고, 이는 현재까지 가장 큰 ego-to-robot 데이터셋이다. 평가를 위해 RoboTwin2.0을 확장해 시각 외형, 장면 배치, 로봇 형태, 과제 의미의 네 축으로 교란을 분리한 벤치마크를 만들었다. 합성 데이터와 실제 로봇 데이터를 1대1로 섞어 사전학습하면 RoboTwin Randomized 53.5%로 로봇 데이터만 쓴 경우보다 2.6포인트 오르고, 실물 로봇 다섯 과제에서도 이득이 확인됐다.

핵심 요약

  • 파이프라인은 손 21개 키포인트에서 가상 손끝(검지 0.7 + 중지 0.3)을 만들어 그리퍼 중심점과 벌림 폭을 뽑고, Savitzky-Golay 필터와 SLERP로 시간축 노이즈를 없앤다. 손 자세 주석이 없는 영상은 WiLoR와 DynHaMR로 자세를 추정하고 Qwen3.5로 긴 영상을 하위 과제로 쪼갠다.
  • 약 1,940시간 원본 영상에서 15개 로봇 형태용 18,561시간 데이터가 나와 약 9.6배로 불어났다.
  • 사전학습 배합 실험에서 1대1 배합이 RoboTwin Clean 68.1%(+5.9), Randomized 53.5%(+2.6), 과제 의미 축 54.1%(+7.9)로 일곱 열 중 다섯 열에서 1위였다. 1대3 배합은 거의 이득이 없었다.
  • 축별로 보면 조명 +7.6, 로봇 색 +6.4, 카메라 오프셋 +5.9로 시각 강건성 이득이 가장 컸다. 처음 보는 물체는 29.3%에서 40.0%(3대1)로 올랐고, 지시문 바꿔쓰기는 68.5%가 됐다. Franka는 7% 아래에 머물러 운동학 차이가 큰 로봇으로의 전이는 실패했다.
  • 로봇 데이터 없이 에고 데이터만 쓴 절제 실험에서 원본 에고 영상 그대로는 28.1%인데 파이프라인을 거치면 31.7%로 올랐고, 형태를 1개에서 15개로 늘리면 33.5%, 여기에 원본 에고 데이터를 더하면 37.3%가 됐다.
  • 실물 ARX ACone 로봇 다섯 개 장기 과제에서 원격조작 시연 20개에 장면당 약 7분짜리 에고 놀이 영상을 변환해 섞은 조합이 가장 좋았고, 블록 넣기 +14, 나사 삽입 +13이었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)