TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

발행일
출처
arXiv
논문 번호
757
분야
Computer Vision
arXiv 번호
2607.27205

LLM을 배제하고 비전+언어를 직접 연결해, 0.2B 파라미터로 32Hz 실시간 로봇 제어를 구현한 효율적인 VLA 모델.

이 논문은 한마디로 로봇 제어에서 거대 언어 모델(LLM) 의존을 빼고도 충분히 잘 작동하는 초경량 VLA 모델을 만들었다는 것이다. 기존 VLA는 비전 정보를 LLM이 처리한 뒤 행동을 만드는 구조(→L→A)라서 느리고 무거웠다. TurboVLA는 비전과 언어를 각각 따로 인코딩한 뒤 가벼운 교차 어텐션(서로의 정보를 섞는 연산)으로 직접 연결해 행동을 생성한다. 결과적으로 0.2B 파라미터, 31ms 지연, 1GB 미만 VRAM으로 LIBERO 벤치마크 97.7% 성공률을 달성했다.

핵심 요약

  • LLM 중심 구조를 제거하고 비전-언어 직접 결합(V+L→A) 방식을 제안했다.
  • 0.2B 파라미터로 π0.5(약 3.4B) 대비 6% 크기이면서도 LIBERO 성공률 97.7%로 동등 이상의 성능을 보였다.
  • 소비자용 RTX 4090에서 32Hz(31.2ms) 추론 속도와 1GB 미만 VRAM을 달성해 엣지 디바이스 배포가 가능하다.
  • 실제 로봇(AgileX Piper) 4개 작업에서 π0.5를 일관되게 뛰어넘는 성능을 보였다.
  • 언어 제거 시 성공률이 70.8%로 떨어져, 실행 수준에서도 언어 조건화가 여전히 중요함을 입증했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)