WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

발행일
출처
arXiv
논문 번호
788
분야
Robotics
arXiv 번호
2607.29613

로봇 강화학습에서 가치 평가자(critic)가 한 장의 이미지만 보고 판단하는 근본적 한계를 지적하고, 미래를 예측하는 월드 모델과 가치 평가를 통합한 새로운 구조를 제안했다.

이 논문은 한마디로 로봇 강화학습의 핵심 부품인 'critic(가치 평가자)'이 단일 프레임만 보고 판단하는 문제를 해결한 연구다. 로봇 조작은 부분 관측(POMDP) 문제라 한 장면만으로는 동작, 접촉, 진행 상태를 알기 어렵다. 저자들은 이 문제의 근본 원인이 '스칼라 값 회귀만으로는 시간에 따른 변화를 학습할 수 없다'는 것임을 밝혔다. 해결책으로 World Critic Model(WCM)을 제안하는데, LeJEPA 구조 위에서 미래 상태를 예측함과 동시에 가치를 추정하도록 훈련된다. 4개 벤치마크 149개 작업에서 일관되게 최고 성능을 달성했고, 특히 낯선 환경에서의 일반화 성능이 크게 뛰어났다.

핵심 요약

  • 기존 VLA 강화학습의 critic이 단일 프레임만 사용하는 근본적 한계를 '상태 근사 문제'로 정의하고, 스칼라 값 회귀로는 시간적 구조를 학습할 수 없음을 밝혔다.
  • WCM은 LeJEPA 구조에서 미래 잠재 상태 예측과 가치 추정을 동시에 수행해서, critic의 표현이 시간적 역학을 포착하도록 명시적으로 훈련된다.
  • π0, π0.5, OpenVLA-OFT 등 최신 VLA 백본과 모두 호환되며, on-policy와 off-policy 훈련 모두에 통합 가능하다.
  • 4개 벤치마크 149개 작업에서 일관되게 최고 성능을 달성했고, 특히 분포 외(OOD) 일반화에서 큰 이득을 보였다.
  • 7개 실제 로봇 조작 작업에서 OpenVLA-OFT와 π0.5 기반 off-policy RL로 안정적인 성능을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)