FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

발행일
출처
arXiv
논문 번호
667
분야
Robotics
arXiv 번호
2607.18231

로봇 조작 모델에 힘 센서 기록을 압축한 기억 토큰을 붙여, 눈으로는 구분이 안 되는 반복 접촉 작업을 세고 수행하게 만든 연구다.

버튼을 몇 번 눌렀는지처럼 과거 이력이 있어야 풀리는 조작 작업은 현재 화면만 보는 기존 VLA 모델로는 풀리지 않는다. 저자들은 손목의 6축 힘/토크 센서 기록 전체를 변분 오토인코더로 미리 학습해 8개의 짧은 기억 토큰으로 압축하고, 여기에 최근 관절 상태 기록을 더해 행동 생성 모듈의 조건으로 넣었다. 양팔 로봇으로 컵 안 숨은 블록 찾기, 버튼 N번 누르기, 그릇 N번 닦기 세 과제를 실험했다. 평균 성공률 83.3%로 기억 없는 기준 모델 27.8%와 시각 기억 기준 모델 53.7%를 크게 앞섰고, 추론 지연은 기준 대비 3ms만 늘었다.

핵심 요약

  • 접촉이 많은 반복 작업은 화면 변화가 거의 없어서 시각 기억으로는 진행 상황을 셀 수 없다는 문제를 짚었다.
  • 힘과 토크 시계열을 재구성 목표로 변분 오토인코더를 먼저 학습시키고, 그 인코더를 얼려 잠재 표현을 기억 토큰으로 썼다.
  • 힘 기억만 쓰면 접촉 전 움직임이 불안정해져서, 짧은 관절 상태 기록을 함께 넣어 보완했다.
  • 세 과제 평균 성공률 83.3%로 기억 없는 파이제로 27.8%, 힘 단기창 기반 TA-VLA 22.2%, 시각 기억 파이-MEM 53.7%를 앞섰다.
  • 추론 지연은 60.7ms에서 64.0ms로 3.3ms만 늘어난 반면, 시각 기억은 프레임 수에 따라 100ms에서 190ms까지 커졌다.
  • 기억 토큰 수는 8개가 최적이었고, 32개로 늘리면 사전학습된 행동 모듈의 토큰 한도를 넘어 오히려 성능이 떨어졌다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)