MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models

발행일
출처
arXiv
논문 번호
385
분야
Robotics
arXiv 번호
2606.09827

VLA 모델에 인지과학 영감의 메모리(과거)와 상상(미래) 메커니즘을 통합한 MemoryVLA++. 과거 상호작용 기억과 미래 상태 예측으로 장기 시계열 로봇 조작을 개선한다.

MemoryVLA++는 인지과학에서 영감받아 작업 기억, 해마체 에피소드 메모리, 내부 모델(상상)을 VLA에 통합한 전체 시간 모델링 프레임워크다. Perceptual-Cognitive Memory Bank가 과거 상호작용의 저수준/고수준 정보를 저장하고, world model이 잠재 공간에서 미래 상태를 상상하며, 이를 통합한 토큰으로 diffusion action expert가 시간적으로 일관된 행동을 예측한다. 5개 시뮬레이션 벤치마크와 3개 실제 로봇 실험에서 강력한 성능을 보이며, 실제 로봇에서 메모리 의존 태스크 +26%, 상상 의존 태스크 +28% 향상을 달성했다.

핵심 요약

  • 인지과학 영감의 전체 시간 모델링: 작업 기억 + 에피소드 메모리 + 미래 상상(world model)
  • Perceptual-Cognitive Memory Bank: 저수준 세부사항과 고수준 의미를 통합 저장, 중복 인식 갱신
  • 잠재 공간 world model로 미래 상태를 부분 denoising만으로 상상, 픽셀 수준 예측 불필요
  • Libero 98.4%, SimplerEnv 74.0% 달성, 실제 로봇에서 일반 +9%, 메모리 +26%, 상상 +28% 향상
  • Calvin 4.29, Mikasa-Robo 44.4%로 장기 시계열 태스크에서 특히 강력
  • RTX 4090에서 66.4 Hz 추론 속도로 실시간 배포 가능 수준

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)