WorldScape Policy 2.0: Empowering Steerable World Action Modeling with Reasoning-Augmented Memory
- 발행일
- 출처
- arXiv
- 논문 번호
- 685
- 분야
- Robotics
- arXiv 번호
- 2607.18840
단기 시각 기억+장기 이벤트 기억을 결합해 긴 호라이즌 로봇 조작을 제어하는 컨트롤러블 월드 액션 모델.
이 논문은 한마디로 로봇이 과거 경험을 기억하고 추론해서 긴 시간 동안 자율적으로 작업을 수행하는 '세계 액션 모델'을 제안했다. 핵심은 단기 시각 기억(최근 관찰)과 장기 이벤트 기억(작업 진행도)을 결합한 것이다. 500만 개 이벤트 세그먼트로 사전 학습한 뒤, 시뮬레이션과 실제 환경에서 테스트했다. 긴 호라이즌 작업 75% 성공, 원인 도메인 명령 수행 86.7%, 새로운 물체에 대한 일반화 60%로 기존 대비 크게 향상됐다. 텍스트, 목표 이미지, 시연 영상으로도 제어할 수 있다.
핵심 요약
- 단기 시각 기억과 장기 이벤트 기억을 결합한 '추론 증강 기억' 구조를 제안했다.
- ManipEvent-5M이라는 500만 개 이벤트 세그먼트 데이터셋을 구축했다.
- 텍스트, 목표 이미지, 시연 영상 등 다양한 방식으로 로봇을 제어할 수 있다.
- 실제 듀얼암 로봇에서 긴 호라이즌 작업 75%, 세밀한 명령 수행 86.7% 성공률을 기록했다.
- 새로운 물체 카테고리에 대한 일반화 성능이 기존 대비 크게 향상됐다 (OOD 60% vs π0.5 43.3%).
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.