Action with Visual Primitives

발행일
출처
arXiv
논문 번호
221
분야
Robotics
arXiv 번호
2605.22183

AVP 프레임워크는 로봇 조작을 안내하기 위해 시각적 프리미티브를 내부적으로 생성하는 종단간 비전-언어-행동 구조를 제안한다.

AVP는 비전-언어 모델과 로봇 행동 전문가 사이의 인터페이스로 점과 상자 같은 시각적 프리미티브를 사용하는 종단간 구조다. 비전-언어 모델이 다음 단계의 대상과 위치를 추론해 시각 프리미티브 토큰을 만들고, 흐름 정합 행동 전문가가 이를 보고 구체적인 움직임을 실행한다. 프리미티브의 정답은 말단 장치의 기구학에서 자동으로 얻으므로 별도 수작업 주석이나 외부 시각 프롬프트 모델이 필요하지 않다. 세 가지 실제 조작 과제에서 π0.5 기준보다 일관되게 높은 성공률을 보였고, 데이터 효율과 공간적 조합 일반화 및 새로운 객체 전이에서도 개선됐다. 다만 프리미티브 예측 뒤 행동을 생성하는 두 단계 방식이라 지연 시간이 늘고, 정확한 손-눈 보정에 의존해 카메라 외부 자세가 흔들리면 민감할 수 있다.

핵심 요약

  • 지시 및 장면 이해: 사전학습된 VLM이 이미지와 텍스트를 처리하여 멀티모달 맥락 토큰을 생성한다. 이 토큰들은 명령(예: "빨간 체스 말을 집어라")과 시각적 장면 사이의 의미적 관계를 포착한다.
  • 공간적 조합 일반화: 모델은 두 단계로 말을 옮기도록(예: 말 A를 C로 옮긴 뒤 C를 B로 옮김) 학습되었다. 테스트 시에는 한 번도 본 적 없는 시퀀스인 A를 B로 직접 옮기라는 요청을 받았다. 베이스라인 모델은 완전히 실패한 반면(성공률 0%), AVP는 83%의 성공률을 유지했다. VLM이 직접 경로에 대한 새로운 어디로(프리미티브)를 추론할 수 있었기 때문에, 특정 궤적이 새로운 것이었음에도 행동 전문가가 어떻게를 실행할 수 있었다.
  • 교차 도메인 일반화: AVP는 보지 못한 물체 범주와 서로 다른 배경(예: 체스판에서 단색 흰 천으로 전환)에서 테스트되었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)