RoboEdit: Turning Human Manipulation Videos into Scalable Robot Experience

발행일
출처
arXiv
논문 번호
958
분야
Robotics
arXiv 번호
2608.18948

사람이 물건을 다루는 영상을 로봇 영상으로 편집·변환해서 로봇 학습 데이터를 대량으로 뽑아내는 도구 모음이다.

이 논문은 한마디로 '넘쳐나는 사람 조작 영상을 로봇 훈련 데이터로 바꾸는' 스위트 RoboEdit를 제안했다. 로봇 손-물체 상호작용 데이터는 수집 비용이 크고 로봇마다 통용되지 않는 반면, 사람 영상은 풍부하지만 몸 구조(엠바디먼트)가 달라 그대로 쓸 수 없다. RoboEdit-Trans는 사람 영상을 처음부터 다시 생성하지 않고 직접 편집해서, 장면·카메라·물체 움직임은 보존한 채 사람 손을 로봇 손으로 바꾼다. 3D 로봇 상태 디코더가 매 프레임 손 상태까지 복원해 구조화된 모션 감독 신호를 준다. RoboEdit-ADC는 RGB 영상에서 3D 상호작용을 재구성·리타게팅해 물리적으로 그럴듯한 짝 데이터를 자동으로 만든다. 이렇게 7종 로봇에 걸쳐 17만4천 개 짝 영상(1,400만 프레임)의 RoboEdit-14M을 구축했고, 실세계 조작 과제에서 하류 제어 정책 학습에 기여함을 확인했다.

핵심 요약

  • 사람 영상을 '새로 생성'하지 않고 '직접 편집'해 원본 장면 맥락과 물리를 보존하는 게 설계의 핵심이다.
  • 크로스엠바디먼트 적응 모듈로 7종 로봇 손의 외형·운동학·접촉 역학을 하나의 에디터로 커버한다.
  • 3D 로봇 상태 디코더가 매 프레임 손 상태를 복원해 하류 학습·제어에 필요한 구조화된 감독 신호를 제공한다.
  • 자동 파이프라인(ADC)이 깊이 정규화와 물리 정제로 물체 침투·부유 접촉·시간 지터 같은 아티팩트를 줄인다.
  • 174K 짝 영상(14M 프레임)·7개 엠바디먼트의 RoboEdit-14M 데이터셋을 구축했고 실세계 조작 정책 학습에 유효했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)