Do as I Do: Dexterous Manipulation Data from Everyday Human Videos

발행일
출처
arXiv
논문 번호
449
분야
Robotics
arXiv 번호
2606.19333

단색 RGB 인간 동영상에서 손-객체 상호작용을 3D로 재구축하고 다지절 로봇 손으로 리타겟팅하는 파이프라인이다. 인터넷 동영상을 실제 로봇 덱스터러스 조작 궤적으로 변환하는 최초의 end-to-end 시스템이다.

DO AS I DO는 일상적인 모노큘러 RGB 인간 동영상에서 손-객체 상호작용을 3D로 재구축하고, 이를 다지절 로봇 손이 실행 가능한 궤적으로 변환하는 파이프라인이다. SAM 3D를 활용한 guided diffusion 기반 객체 추적과 sampling-based 최적화 리타겟팅을 결합하여, 기존 SOTA를 능가하는 재구축 정확도와 71% 리타겟팅 성공률을 달성했다. 인터넷, 자아중심, 생성 동영상 등 다양한 소스에서 500개의 고품질 조작 궤적을 생성하고 실제 로봇으로 검증했다.

핵심 요약

  • SAM 3D 생성 모델을 비디오 객체 추적기로 재활용하는 guided diffusion 기법을 제안하여 FoundationPose 대비 67% 우위의 추적 성능 달성
  • DexYCB와 HOI4D 벤치마크에서 SOTA 재구축 정확도 달성 (F-5: 0.71/0.72, CD: 0.66/0.49)
  • Warmup, perturbation, transition reward 등 3가지 혁신 컴포넌트로 리타겟팅 성공률을 25%→71%로 향상
  • OakInk2 MoCap 벤치마크에서도 72%→81% 성능 향상으로 클린 데이터에서도 유효함 입증
  • 100DOH 데이터셋 분석 결과, 온라인 인간 동영상의 약 4%만이 덱스터러스 조작 학습에 직접 활용 가능함을 확인
  • 22-DoF Sharpa Wave 핸드 + UR3e 암 양손 시스템에서 10가지 과제(저어주기, 붓기, 닦기 등) 실제 실행 검증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)