Reinforcement Learning for Real-Time Vision-Language-Action Policies

발행일
출처
arXiv
논문 번호
1089
분야
Robotics
arXiv 번호
2609.18207

거대 로봇 비전-언어-행동(VLA) 모델이 느려서 행동이 늦는 문제를, 큰 모델은 행동을 '제안'하고 작은 수정 정책이 최신 관측을 보고 즉시 '수정'하는 이중 구조로 풀고 강화학습으로 미세조정한 논문.

이 논문은 한마디로 느린 큰 로봇 모델과 빠른 작은 수정 모듈을 나눠 실시간 로봇 제어를 가능하게 만들고, 여기에 강화학습을 얹어 성능까지 끌어올린 연구다. 큰 VLA 모델은 행동 묶음을 천천히 제안하고, 가벼운 수정 정책(edit policy)이 최신 카메라 정보를 보며 실행 직전에 행동을 고친다. 공이 굴러가는 접시 받침, 회전하는 물건 집기 같은 빠른 반응이 필요한 실제 과제에서 온라인 데이터 10분 만에 평균 성공률을 42%에서 97%로 올렸다. 시뮬레이션 벤치마크(Kinetix)에서도 지연이 있는 방법 중 10개 환경 모두에서 최고 성적을 냈다.

핵심 요약

  • 큰 VLA 모델의 추론 지연 때문에 실행 시점의 관측이 낡는 문제를 '느린 제안 + 빠른 수정' 이중 구조로 해결했다.
  • 모방학습 기반이던 기존 실시간 실행 방식과 달리, 강화학습 미세조정으로 훈련 분포를 넘어 신뢰성을 높였다.
  • 실제 로봇 4개 과제(물건 전달, 공 균형, 탁구공 차기, 동적 집기)에서 온라인 데이터 10분 만에 성능을 42%에서 97%로 끌어올렸다.
  • 사람의 개입 없이 학습이 자동으로 돌아가는 점이 실제 현장 적용에서 중요한 의미를 갖는다.
  • Kinetix 시뮬레이션 벤치마크에서 지연/무지연 모든 방법을 제치고 10개 환경 전부에서 최고 성능을 냈다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)