RoboEdit: Turning Human Manipulation Videos into Scalable Robot Experience
- 발행일
- 출처
- arXiv
- 논문 번호
- 958
- 분야
- Robotics
- arXiv 번호
- 2608.18948
사람이 물건을 다루는 영상을 로봇 영상으로 편집·변환해서 로봇 학습 데이터를 대량으로 뽑아내는 도구 모음이다.
이 논문은 한마디로 '넘쳐나는 사람 조작 영상을 로봇 훈련 데이터로 바꾸는' 스위트 RoboEdit를 제안했다. 로봇 손-물체 상호작용 데이터는 수집 비용이 크고 로봇마다 통용되지 않는 반면, 사람 영상은 풍부하지만 몸 구조(엠바디먼트)가 달라 그대로 쓸 수 없다. RoboEdit-Trans는 사람 영상을 처음부터 다시 생성하지 않고 직접 편집해서, 장면·카메라·물체 움직임은 보존한 채 사람 손을 로봇 손으로 바꾼다. 3D 로봇 상태 디코더가 매 프레임 손 상태까지 복원해 구조화된 모션 감독 신호를 준다. RoboEdit-ADC는 RGB 영상에서 3D 상호작용을 재구성·리타게팅해 물리적으로 그럴듯한 짝 데이터를 자동으로 만든다. 이렇게 7종 로봇에 걸쳐 17만4천 개 짝 영상(1,400만 프레임)의 RoboEdit-14M을 구축했고, 실세계 조작 과제에서 하류 제어 정책 학습에 기여함을 확인했다.
핵심 요약
- 사람 영상을 '새로 생성'하지 않고 '직접 편집'해 원본 장면 맥락과 물리를 보존하는 게 설계의 핵심이다.
- 크로스엠바디먼트 적응 모듈로 7종 로봇 손의 외형·운동학·접촉 역학을 하나의 에디터로 커버한다.
- 3D 로봇 상태 디코더가 매 프레임 손 상태를 복원해 하류 학습·제어에 필요한 구조화된 감독 신호를 제공한다.
- 자동 파이프라인(ADC)이 깊이 정규화와 물리 정제로 물체 침투·부유 접촉·시간 지터 같은 아티팩트를 줄인다.
- 174K 짝 영상(14M 프레임)·7개 엠바디먼트의 RoboEdit-14M 데이터셋을 구축했고 실세계 조작 정책 학습에 유효했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.