HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining
- 발행일
- 출처
- arXiv
- 논문 번호
- 461
- 분야
- Computer Vision
- arXiv 번호
- 2606.20521
에고센트릭 인간 영상이 로봇 원격조종 데이터보다 embodied 사전학습에 더 효과적임을 체계적으로 입증한 연구. 동일 규모에서 검증 손실 24% 감소, OOD 성공률 90% 달성.
HumanScale은 에고센트릭 인간 영상과 원격조종 로봇 데이터를 embodied 파운데이션 모델의 사전학습 소스로 직접 비교한 체계적 연구다. 5,000시간 규모로 동일 조건 실험한 결과, 에고센트릭 데이터가 검증 손실 24% 감소, in-distribution 성공률 52.5% 향상, OOD 성공률 90% 달성 등 로봇 데이터를 능가했다. 인간 영상으로 세계 표현을 학습하고 소량의 로봇 데이터로 액션 정렬을 하는 확장 가능한 패러다임을 제시한다.
핵심 요약
- 에고센트릭 사전학습은 데이터 증가에 따라 validation loss가 단조 감소하며 명확한 스케일링 법칙을 보임
- 동일 5,000시간 규모에서 에고센트릭이 로봇 데이터 대비 validation loss 24% 감소, in-distribution 성공률 40%→92.5%, OOD 성공률 0%→90%
- World-Action Model(MoT 아키텍처) 기반 비교로 video generation + action prediction 결합 프레임워크 사용
- 에고센트릭 영상이 더 낮은 normalized jerk(더 부드러운 모션)와 더 적은 idle fraction을 가져 데이터 효율이 높음
- 실제 로봇 실험(AgiBot 바이매니플레이터)에서 에고센트릭 사전학습 모델은 OOD 객체에도 90% 성공률 유지, baseline은 0%로 붕괴
- 로봇 데이터는 스케일을 키워도 unseen 태스크 일반화가 거의 향상되지 않아 실--로봇 데이터의 근본적 한계를 입증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.