MemoryWAM: Efficient World Action Modeling with Persistent Memory
- 발행일
- 출처
- arXiv
- 논문 번호
- 456
- 분야
- Robotics
- arXiv 번호
- 2606.20562
하이브리드 메모리로 효율적인 영구 기억을 가진 세계 행동 모델. RMBench에서 83.0% 성공률로 기존 WAM 대비 크게 앞선다.
MemoryWAM은 단기(슬라이딩 윈도우), 장기(gist 토큰), 이벤트 경계(앵커 프레임) 메모리를 결합한 하이브리드 설계로 긴 시퀀스에서도 O(N/d) 비용으로 영구 기억을 유지한다. RMBench에서 π0.5(10.4%), FastWAM(5.9%)과 비교해 83.0% 성공률을 달성하며 full-history 방식인 LingBot-VA(78.2%)도 능가한다. 실제 로봇 실험에서도 Shell Game 90%, Look and Press 75%를 기록했으며, 1600프레임에서도 효율성을 유지한다.
핵심 요약
- 슬라이딩 윈도우(단기) + gist 토큰(장기) + 앵커 프레임(이벤트 경계)의 하이브리드 메모리 설계
- 시간/공간 복잡도 O(N) → O(N/d) 감소 (d=압축률)로 실시간 제어 가능
- RMBench 9개 과제 평균 83.0% (LingBot-VA 78.2% 대비 +4.8pp, FastWAM 5.9% 대비 압도적)
- 실제 로봇: Shell Game 18/20, Look and Press 15/20 달성
- Gist 토큰 제거 시 가장 큰 성능 저하(92.5%→40%) → 장기 기억의 결정적 역할
- 1600프레임에서도 full attention(RNN/TTT) 대비 우수한 효율성과 동일 87% 성능 유지
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.