Robots Acquire Manipulation Skills in Seconds from a Single Human Video

발행일
출처
arXiv
논문 번호
692
분야
Robotics
arXiv 번호
2607.20033

로봇이 사람 영상 하나만 보고 29초 만에 새 조작 기술을 배우면서 기존 기술도 잃지 않는 프레임워크를 제안한 논문이다.

이 논문은 한마디로 로봇이 인간의 영상 한 개만 보고 추론 시점에서 즉시 새 기술을 습득하는 HOST 프레임워크를 제안한 것이다. 기존 방식은 새 기술마다 데이터 수집과 미세조정이 필요했고, 이 과정에서 기존 기술이 망가졌다. HOST는 작업 진행도를 추정하고, 영상의 미래 진행을 로봇 자신의 관점으로 번역한 뒤, 거기서 행동을 이끌어내는 자기 정답 예측 구조로 이 문제를 풀었다.

핵심 요약

  • 사람 영상 1개로 평균 29초 만에 새 기술을 습득한다 (기존 대비 507배 빠름).
  • 평균 62% 성공률을 달성하며, 제로샷 기준보다 +45%, 50개 로봇 데모로 미세조정한 기준보다도 높다.
  • 학습 파라미터를 건드리지 않아 기존 기술이 100% 보존된다 (파괴적 망각 제로).
  • 작업 진행 매니폴드로 영상과 로봇 궤적을 정렬해서 시간 불일치와 상태 차이를 해결했다.
  • 국소화→미래 관측 예측→행동 생성의 인과적 캐스케이드로 추론 시점 적응을 구현했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)