Spatial Memory for Out-of-Vision Manipulation in Vision-Language-Action

발행일
출처
arXiv
논문 번호
222
분야
Robotics
arXiv 번호
2605.22283

비전-언어-행동 모델용 프레임워크인 SOMA는 다시점 관측으로 구성된 지속적 공간 메모리를 통합하여, 처음부터 또는 일시적으로 카메라 시야 밖에 있는 물체에 대한 견고한 로봇 조작을 가능하게 한다.

SOMA는 현재 카메라 화면 밖에 있는 물체도 다룰 수 있도록 비전-언어-행동 모델에 지속적인 공간 기억을 추가하는 프레임워크다. 움직이는 머리 카메라로 여러 방향을 관찰해 객체와 기하 관계를 하나의 공간-의미 기억으로 만들고, 새 관측으로 이를 갱신한다. 작업 지시와 관련된 기억만 현재 시각 특징에 불러와 물체가 보이지 않는 동안에도 위치를 추론하고 행동을 생성한다. 다섯 개의 실제 화면 밖 조작 과제에서 성공률을 높이고 목표 탐색 시간을 줄였으며, 완전히 보이는 RoboCasa와 SimplerEnv 설정에서도 기억 구조의 이점을 확인했다. 다만 현재 검증은 준정적인 탁상 장면 중심이고 기억의 의미 단위가 객체 수준이어서, 복잡한 상태 변화와 방 규모 환경 및 오래되어 틀린 기억을 안전하게 처리하는 문제가 남는다.

핵심 요약

  • 기하 추정: 기하 사전 네트워크(VGGT)가 카메라 자세와 대략적인 장면 기하를 추정하여 전역 3D 좌표계를 확립한다.
  • 탐색 노력 감소: 목표 물체를 찾는 데 필요한 시간이 약 40~59% 감소했다.
  • 결단력 있는 움직임: 로봇은 시점 보정(헤드 카메라가 목표를 포착한 뒤 방향을 재조정해야 하는 경우)을 더 적게 보였는데, 이는 공간 메모리가 로봇이 파지를 결단하기에 충분히 신뢰할 만한 추정을 제공했음을 시사한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)