WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory

발행일
출처
arXiv
논문 번호
685
분야
Robotics
arXiv 번호
2607.18840

단기 시각 기억+장기 이벤트 기억을 결합해 긴 호라이즌 로봇 조작을 제어하는 컨트롤러블 월드 액션 모델.

이 논문은 한마디로 로봇이 과거 경험을 기억하고 추론해서 긴 시간 동안 자율적으로 작업을 수행하는 '세계 액션 모델'을 제안했다. 핵심은 단기 시각 기억(최근 관찰)과 장기 이벤트 기억(작업 진행도)을 결합한 것이다. 500만 개 이벤트 세그먼트로 사전 학습한 뒤, 시뮬레이션과 실제 환경에서 테스트했다. 긴 호라이즌 작업 75% 성공, 원인 도메인 명령 수행 86.7%, 새로운 물체에 대한 일반화 60%로 기존 대비 크게 향상됐다. 텍스트, 목표 이미지, 시연 영상으로도 제어할 수 있다.

핵심 요약

  • 단기 시각 기억과 장기 이벤트 기억을 결합한 '추론 증강 기억' 구조를 제안했다.
  • ManipEvent-5M이라는 500만 개 이벤트 세그먼트 데이터셋을 구축했다.
  • 텍스트, 목표 이미지, 시연 영상 등 다양한 방식으로 로봇을 제어할 수 있다.
  • 실제 듀얼암 로봇에서 긴 호라이즌 작업 75%, 세밀한 명령 수행 86.7% 성공률을 기록했다.
  • 새로운 물체 카테고리에 대한 일반화 성능이 기존 대비 크게 향상됐다 (OOD 60% vs π0.5 43.3%).

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)