FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 667
- 분야
- Robotics
- arXiv 번호
- 2607.18231
로봇 조작 모델에 힘 센서 기록을 압축한 기억 토큰을 붙여, 눈으로는 구분이 안 되는 반복 접촉 작업을 세고 수행하게 만든 연구다.
버튼을 몇 번 눌렀는지처럼 과거 이력이 있어야 풀리는 조작 작업은 현재 화면만 보는 기존 VLA 모델로는 풀리지 않는다. 저자들은 손목의 6축 힘/토크 센서 기록 전체를 변분 오토인코더로 미리 학습해 8개의 짧은 기억 토큰으로 압축하고, 여기에 최근 관절 상태 기록을 더해 행동 생성 모듈의 조건으로 넣었다. 양팔 로봇으로 컵 안 숨은 블록 찾기, 버튼 N번 누르기, 그릇 N번 닦기 세 과제를 실험했다. 평균 성공률 83.3%로 기억 없는 기준 모델 27.8%와 시각 기억 기준 모델 53.7%를 크게 앞섰고, 추론 지연은 기준 대비 3ms만 늘었다.
핵심 요약
- 접촉이 많은 반복 작업은 화면 변화가 거의 없어서 시각 기억으로는 진행 상황을 셀 수 없다는 문제를 짚었다.
- 힘과 토크 시계열을 재구성 목표로 변분 오토인코더를 먼저 학습시키고, 그 인코더를 얼려 잠재 표현을 기억 토큰으로 썼다.
- 힘 기억만 쓰면 접촉 전 움직임이 불안정해져서, 짧은 관절 상태 기록을 함께 넣어 보완했다.
- 세 과제 평균 성공률 83.3%로 기억 없는 파이제로 27.8%, 힘 단기창 기반 TA-VLA 22.2%, 시각 기억 파이-MEM 53.7%를 앞섰다.
- 추론 지연은 60.7ms에서 64.0ms로 3.3ms만 늘어난 반면, 시각 기억은 프레임 수에 따라 100ms에서 190ms까지 커졌다.
- 기억 토큰 수는 8개가 최적이었고, 32개로 늘리면 사전학습된 행동 모듈의 토큰 한도를 넘어 오히려 성능이 떨어졌다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.