HumanEgo: Zero-Shot Robot Learning from Minutes of Human Egocentric Videos
- 발행일
- 출처
- arXiv
- 논문 번호
- 235
- 분야
- Robotics
- arXiv 번호
- 2605.24934
메릴랜드 대학교의 연구진은 몇 분 분량의 인간 1인칭 영상 시연만으로 제로샷 로봇 조작 정책 학습을 가능하게 하는 프레임워크 HumanEgo를 개발했다.
HumanEgo는 로봇 시연 없이 몇 분 분량의 사람 1인칭 영상만으로 조작 정책을 학습하는 프레임워크다. 사람의 손과 물체 관계를 개체 수준의 상호작용 중심 토큰으로 바꾸고, 흐름 정합 정책에 물체 움직임과 시각 궤적 및 잠재 일관성 보조 목표를 함께 학습한다. 과제당 30분의 사람 영상으로 네 가지 실제 작업에서 평균 성공률 92.5%를 기록했고, 15분만 사용해도 75%를 달성했다. 같은 시간의 로봇 원격조작 데이터보다 41% 높은 성능을 보였으며 새 로봇, 카메라, 환경에도 추가 학습 없이 전이됐다. 다만 스테레오 손 추적과 여러 외부 인식 모듈에 의존해 오류가 이어질 수 있고, 가림이나 빠른 움직임 및 1센티미터보다 정밀한 접촉 작업에는 추가 개선이 필요하다.
핵심 요약
- 새로운 시점은 서로 다른 카메라 각도와 높이를 가리킨다.
- 시각적 방해 요소는 학습 중에는 없었던 추가 객체가 테이블 위에 놓인 경우다.
- 새로운 객체는 인간 영상에서 본 것과 다른 종류의 빵이나 컵을 사용하는 경우다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.