Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization

발행일
출처
arXiv
논문 번호
1018
분야
Robotics
arXiv 번호
2608.26103

로봇에게 사람 영상을 '문제 지시'로 보여주면 훈련 못 본 작업도 바로 수행하게 만든 논문. 사람-로봇 짝 데이터 7.4만 쌍을 자동 생성한 게 핵심.

이 논문은 한마디로 '사람이 하는 걸 영상으로 보여주면 로봇이 처음 보는 작업을 바로 수행한다'는 접근이다. LLM의 인컨텍스트 학습(예시를 프롬프트로 주면 파라미터 수정 없이 새 작업을 수행)을 로봇에 가져왔다. 로봇 궤적에서 의미가 맞는 사람 영상을 자동으로 만들어 HumanGen 데이터(7.42만 쌍, 8,600 작업)를 구축했고, 모델이 영상 프롬프트를 진짜 참고하게 만드는 학습 목표(IFP)를 제안했다. 그 결과 못 본 작업 7개에서 평균 성공률 47.0%로, 최강 베이스라인보다 29.5%p 앞섰다.

핵심 요약

  • 언어 지시는 공간 제약이나 중간 상태를 담기 어려워서, 사람 시연 영상을 작업 지시 인터페이스로 채택했다.
  • 로봇 궤적에서 의미가 일치하는 사람 영상을 자동 생성하는 파이프라인으로 HumanGen 7.42만 쌍(8,600 작업)을 만들었다.
  • 기존 작업 지식의 지름길에 기대지 않게 미래 구간 예측(IFP) 목표를 추가해 모델이 영상 프롬프트를 강제로 참고하게 했다.
  • RoboTwin 2.0에서 못 본 작업 7개 평균 성공률 47.0%로 최강 베이스라인(LingBot-VA) 대비 +29.5%p를 기록했다.
  • 실제 로봇에서도 다중 물체·장기 과제·정밀 삽입 같은 못 본 구성에서 영상 지시를 잘 따라갔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)