TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM
- 발행일
- 출처
- arXiv
- 논문 번호
- 757
- 분야
- Computer Vision
- arXiv 번호
- 2607.27205
LLM을 배제하고 비전+언어를 직접 연결해, 0.2B 파라미터로 32Hz 실시간 로봇 제어를 구현한 효율적인 VLA 모델.
이 논문은 한마디로 로봇 제어에서 거대 언어 모델(LLM) 의존을 빼고도 충분히 잘 작동하는 초경량 VLA 모델을 만들었다는 것이다. 기존 VLA는 비전 정보를 LLM이 처리한 뒤 행동을 만드는 구조(→L→A)라서 느리고 무거웠다. TurboVLA는 비전과 언어를 각각 따로 인코딩한 뒤 가벼운 교차 어텐션(서로의 정보를 섞는 연산)으로 직접 연결해 행동을 생성한다. 결과적으로 0.2B 파라미터, 31ms 지연, 1GB 미만 VRAM으로 LIBERO 벤치마크 97.7% 성공률을 달성했다.
핵심 요약
- LLM 중심 구조를 제거하고 비전-언어 직접 결합(V+L→A) 방식을 제안했다.
- 0.2B 파라미터로 π0.5(약 3.4B) 대비 6% 크기이면서도 LIBERO 성공률 97.7%로 동등 이상의 성능을 보였다.
- 소비자용 RTX 4090에서 32Hz(31.2ms) 추론 속도와 1GB 미만 VRAM을 달성해 엣지 디바이스 배포가 가능하다.
- 실제 로봇(AgileX Piper) 4개 작업에서 π0.5를 일관되게 뛰어넘는 성능을 보였다.
- 언어 제거 시 성공률이 70.8%로 떨어져, 실행 수준에서도 언어 조건화가 여전히 중요함을 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.