HumanScale: Egocentric Human Video Can Outperform Real-Robot Data for Embodied Pretraining

발행일
출처
arXiv
논문 번호
461
분야
Computer Vision
arXiv 번호
2606.20521

에고센트릭 인간 영상이 로봇 원격조종 데이터보다 embodied 사전학습에 더 효과적임을 체계적으로 입증한 연구. 동일 규모에서 검증 손실 24% 감소, OOD 성공률 90% 달성.

HumanScale은 에고센트릭 인간 영상과 원격조종 로봇 데이터를 embodied 파운데이션 모델의 사전학습 소스로 직접 비교한 체계적 연구다. 5,000시간 규모로 동일 조건 실험한 결과, 에고센트릭 데이터가 검증 손실 24% 감소, in-distribution 성공률 52.5% 향상, OOD 성공률 90% 달성 등 로봇 데이터를 능가했다. 인간 영상으로 세계 표현을 학습하고 소량의 로봇 데이터로 액션 정렬을 하는 확장 가능한 패러다임을 제시한다.

핵심 요약

  • 에고센트릭 사전학습은 데이터 증가에 따라 validation loss가 단조 감소하며 명확한 스케일링 법칙을 보임
  • 동일 5,000시간 규모에서 에고센트릭이 로봇 데이터 대비 validation loss 24% 감소, in-distribution 성공률 40%→92.5%, OOD 성공률 0%→90%
  • World-Action Model(MoT 아키텍처) 기반 비교로 video generation + action prediction 결합 프레임워크 사용
  • 에고센트릭 영상이 더 낮은 normalized jerk(더 부드러운 모션)와 더 적은 idle fraction을 가져 데이터 효율이 높음
  • 실제 로봇 실험(AgiBot 바이매니플레이터)에서 에고센트릭 사전학습 모델은 OOD 객체에도 90% 성공률 유지, baseline은 0%로 붕괴
  • 로봇 데이터는 스케일을 키워도 unseen 태스크 일반화가 거의 향상되지 않아 실--로봇 데이터의 근본적 한계를 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)