Learning Latent Action World Models In The Wild

발행일
출처
arXiv
논문 번호
106
분야
World Models
arXiv 번호
2601.05230

Meta의 FAIR 연구진은 다양하고 레이블이 없는 '야생' 비디오 데이터로부터 직접 효과적인 잠재 행동 세계 모델을 학습하는 방법을 개발했다.

Meta의 FAIR 연구진은 다양하고 레이블이 없는 '야생' 비디오 데이터로부터 직접 효과적인 잠재 행동 세계 모델을 학습하는 방법을 개발했다. 이 접근법은 명시적 행동 레이블로 학습한 모델에 필적하는 수준의 로봇 조작 및 내비게이션 과제 계획 성능을 가능하게 한다.

핵심 요약

  • 대부분의 성공적인 세계 모델은 명시적 행동 레이블에 의존하여, 방대한 양의 레이블 없는 실제 비디오 데이터에 적용할 때 확장성과 일반성이 제한된다.
  • 기존 잠재 행동 모델(LAM)은 제한된 환경에 국한되어, 다양한 실제 시나리오로의 전이성과 일반화가 부족한 행동 공간을 초래했다.
  • '야생' 비디오는 명확히 정의되지 않은 행동, 환경적 잡음, 공통된 체화의 부재 같은 문제를 제기하여, 의미 있는 행동 표현을 추출하기 어렵게 만든다.
  • 동결된 V-JEPA 2-L 시각 인코더를 활용하여, 대규모의 레이블 없는 '야생' 비디오 데이터셋에서 세계 모델과 역동역학 모델(IDM)을 공동 학습하는 프레임워크다.
  • 연속 잠재 행동의 내용을 제어하고 무관한 정보의 인코딩을 방지하기 위한 정보 정규화 기법(희소성, 잡음 추가(VAE 유사), 이산화)을 조사한다.
  • 미래 누출과 행동 전이성 같은 본질적 지표를 통해, 그리고 경량 컨트롤러와 Cross-Entropy Method를 통한 다운스트림 계획 과제에서의 실용적 유용성을 통해 학습한 잠재 행동 공간을 평가한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)