UniMem: Unifying Multimodal Memory and Control for Vision-Language-Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 999
- 분야
- Robotics
- arXiv 번호
- 2608.22869
이 논문은 로봇 팔 제어 모델(VLA)에 사건 단위 기억을 하나의 모델 안에 통합해, 기억이 필요한 과제의 성공률을 크게 올리면서도 실시간 속도를 유지했다.
이 논문은 한마디로 로봇이 '아까 뭘 했지'를 기억하게 만든 프레임워크다. UniMem은 사건 분류기가 과제의 중요 순간을 잡아내면 텍스트 기억과 핵심 프레임을 캐시에 저장하고, 이를 행동 예측에 직접 조건으로 준다. 기억 관리용 대형 VLM을 따로 얹는 계층형 방식과 달리 하나의 백본이 기억과 제어를 함께 처리해서, 시뮬레이션 93.4%·실기 80.0% 성공률을 냈다. 논문은 수십 분에서 몇 시간에 이르는 더 긴 과제에서는 아직 검증하지 못했다고 밝힌다.
핵심 요약
- 사건 분류기가 백본 잠재공간에서 과제 핵심 순간을 감지해 텍스트·핵심프레임 기억을 갱신한다.
- 기억 관리용 VLM을 따로 두지 않고 기억과 저수준 제어를 한 백본(π0.5)에 통합했다.
- 핵심프레임 캐싱으로 프레임당 약 90ms의 단일 프레임 수준 속도를 지켜 계층형 기억 방식보다 6배 빠르고, 표준 워크스테이션 GPU에서 카메라 4대짜리 양팔 설정까지 속도 손해 없이 늘릴 수 있다.
- 시뮬레이션 5과제 평균 93.4%(고정 간격 프레임 기준선 68.2%), 실기 4과제 평균 80.0%(계층형 MemER 43.5%)를 기록했다.
- 다만 훈련 때의 연산 한계로 과거 이정표를 세 개까지만 담고, 이 한도를 넘으면 가장 오래된 프레임을 버린다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.