HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos

발행일
출처
arXiv
논문 번호
235
분야
Robotics
arXiv 번호
2605.24934

메릴랜드 대학교의 연구진은 몇 분 분량의 인간 1인칭 영상 시연만으로 제로샷 로봇 조작 정책 학습을 가능하게 하는 프레임워크 HumanEgo를 개발했다.

HumanEgo는 로봇 시연 없이 몇 분 분량의 사람 1인칭 영상만으로 조작 정책을 학습하는 프레임워크다. 사람의 손과 물체 관계를 개체 수준의 상호작용 중심 토큰으로 바꾸고, 흐름 정합 정책에 물체 움직임과 시각 궤적 및 잠재 일관성 보조 목표를 함께 학습한다. 과제당 30분의 사람 영상으로 네 가지 실제 작업에서 평균 성공률 92.5%를 기록했고, 15분만 사용해도 75%를 달성했다. 같은 시간의 로봇 원격조작 데이터보다 41% 높은 성능을 보였으며 새 로봇, 카메라, 환경에도 추가 학습 없이 전이됐다. 다만 스테레오 손 추적과 여러 외부 인식 모듈에 의존해 오류가 이어질 수 있고, 가림이나 빠른 움직임 및 1센티미터보다 정밀한 접촉 작업에는 추가 개선이 필요하다.

핵심 요약

  • 새로운 시점은 서로 다른 카메라 각도와 높이를 가리킨다.
  • 시각적 방해 요소는 학습 중에는 없었던 추가 객체가 테이블 위에 놓인 경우다.
  • 새로운 객체는 인간 영상에서 본 것과 다른 종류의 빵이나 컵을 사용하는 경우다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)