In-Context Robot Learning with VLM Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 1090
- 분야
- Computer Vision
- arXiv 번호
- 2609.19138
상용 VLM(GPT-6 등)을 로봇 전용 학습 없이 그대로 연결해, 사람 영상 시연이나 상호작용 기록만 보고 즉석에서 새 로봇 과제에 적응하는 '문맥 학습' 프레임워크를 제안한 논문.
이 논문은 한마디로 로봇 전용 훈련을 받지 않은 범용 비전-언어 모델(VLM)이 시연 영상만 보고 새 과제를 즉석에서 수행할 수 있는지를 검증한 연구다. GPT-Policy 프레임워크는 과제에 필요한 장면 전환만 골라 담는 문맥 컴파일러, VLM이 도구 행동을 제안하는 부분, 행동을 검증·실행하는 제한적 컨트롤러 세 부분으로 이뤄진다. 실제 로봇 실험에서 사람 동영상 시연만 줘도(로봇 행동 라벨 없이) 과제 완수율이 올라갔고, 접촉이 민감한 과제에선 정렬된 행동 참고자료가 추가 이득을 냈다. 다만 정확한 접촉이나 결과 검증 같은 물리 실행의 마지막 신뢰성은 여전히 풀 과제로 남았다.
핵심 요약
- 로봇 학습 없이 상용 VLM의 능력만으로 현장 적응이 어느 정도 되는지를 체계적으로 측정한 첫 사례에 가깝다.
- 사람 동영상 시연만으로도 과제 진행률이 55%에서 100%로 올라가고, 실행 시간과 토큰 사용량도 줄었다.
- 목표 이미지, 로봇 영상+행동, 상호작용 기록 등 5가지 문맥 형태를 같은 실행 틀 안에서 비교했다.
- 티택토 같은 인간-로봇 상호작용 과제에서 GPT-6 Astra가 3/3 성공하며 차례 지키기와 전략 추론을 함께 해냈다.
- 반면 정밀 접촉, 결과 검증, 안전 문제는 범용 모델만으로 해결되지 않는 한계를 명확히 드러냈다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.