JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

발행일
출처
arXiv
논문 번호
860
분야
Robotics
arXiv 번호
2608.09381

이 논문은 로봇 제어를 위해 비디오 생성 없이 잠재 공간에서 미래 상태를 예측하는 세계 모델(JEPA-WAM)을 만들었다. 추론 시 비디오 모델이 필요 없어 빠르면서도, 외부 상황 변화에 강하다.

이 논문은 한마디로 로봇이 행동할 때 '다음에 뭐가 일어날까'를 비디오 생성 없이 잠재 표현(latent)으로 예측하는 방법을 제안했다. V-JEPA(비디오 사전학습 모델) 공간에서 현재-미래 관계를 jointly 예측하고, 그 예측이 행동 생성 백본을 직접 형성한다. 추론 시점에는 예측 브랜치를 떼어내서 VLA 수준의 속도를 유지하면서 LIBERO-Plus에서 79.2%(사전학습 없이 최고), π0.5 결합 시 86.3%(전체 최고)를 달성했다.

핵심 요약

  • 미리 학습된 V-JEPA 표현 공간에서 비디오를 직접 생성하지 않고 현재와 미래의 공간 구조 관계를 예측하는 잠재 세계행동 모델을 제안했다.
  • 전이 예측과 연속 행동 생성을 하나의 예측기에 묶어 미래 감독 신호가 행동 표현을 만드는 핵심 구조를 직접 다듬게 했다.
  • LIBERO-Plus에서 사전 로봇 정책 학습이 없는 설정은 79.2%, π0.5에 결합한 설정은 86.3%로 각각 가장 높은 결과를 냈다.
  • RoboTwin 2.0과 실제 양팔 로봇에서도 시각·공간 조건 변화에 대한 일반화를 보여 비디오 생성 비용 없이 로봇 제어에 적용할 가능성을 보였다.
  • 전이 목표가 언어와 무관한 공통 시각 구조를 배우므로 같은 장면에서도 지시에 따라 미래가 크게 달라지는 과제에는 표현력이 부족할 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)