Show-Harness: Just a VLM Agent Can Play Robots
- 발행일
- 출처
- arXiv
- 논문 번호
- 1077
- 분야
- Robotics
- arXiv 번호
- 2609.10522
VLM(이미지를 이해하는 AI)이 로봇을 '게임처럼 조작'할 수 있게 해주는 인터페이스를 만들어, 추가 학습 없이도 프론티어 모델이 로봇 팔을 제어할 수 있음을 보인 논문.
이 논문은 한마디로 'AI가 로봇을 조종하기 어려운 이유는 모델이 아니라 인터페이스 때문'이라며, 사람이 이해하는 수준의 간단한 동작 명령(전진·회전·집기 등)으로 로봇을 조작하는 방법을 제안했다. VLM이 이 명령들을 골라내면 로봇마다 붙는 '해석기'가 실제 움직임으로 확정적으로 바꿔주는 구조다. 이 방식만으로 구형 최신 VLM(Gemini-3.1 Pro)을 파인튜닝 없이(제로샷) 로봇 제어에 쓸 수 있었고, 실제 과제에서 96% 성공률을 기록했다. 작은 2B급 오픈소스 모델도 GPU 몇 시간만 학습하면 같은 방식으로 로봇을 다룰 수 있었다. 또한 GUI(화면 클릭 인터페이스)로 사람과 에이전트가 특수 장비 없이 로봇 시연 데이터를 모을 수 있는 GUMI 도구도 함께 만들었다.
핵심 요약
- VLA(비전-언어-행동 모델)처럼 로봇 전용 재학습을 하지 않고, 의미 있는 동작 단위 인터페이스만으로 기초 VLM의 지능을 로봇 제어로 끌어냈다.
- 최신 폐쇄형 VLM을 학습 없이(제로샷) 그대로 로봇 에이전트로 쓸 수 있음을 실제 로봇 팔 실험에서 확인했다.
- 작은 오픈소스 VLM(2B급)도 몇 GPU시간의 가벼운 파인튜닝만으로 같은 동작 공간에서 로봇을 다룰 수 있어, 저비용 배포 경로도 열렸다.
- 작업·로봇 형태·환경이 바뀌어도 기존 에이전트 방식과 VLA 방식보다 일반화가 좋았다.
- GUMI라는 GUI 기반 조작 화면을 만들어, 값비싼 원격조종 장비 없이도 사람과 에이전트가 로봇 시연 데이터를 함께 수집할 수 있게 했다.
- 핵심 구성요소를 하나씩 빼는 실험에서 계획·실패 복구·동작 기록 등이 성공률을 최대 24~35%p 끌어올린다는 걸 보여줬다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.