LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation
- 발행일
- 출처
- arXiv
- 논문 번호
- 1054
- 분야
- Robotics
- arXiv 번호
- 2608.30935
4B 소형 VLM 하나에 '가리키기' 인터페이스를 얹어 과제별 전용 헤드 없이 길찾기·물건 탐색·추적을 전부 처리하게 만든 범용 로봇 내비게이션 모델이다.
이 논문은 한마디로 소형 VLM(Qwen3-VL-4B) 하나를 로봇 내비게이션 만능 두뇌로 만든 것이다. '무엇을 향해 가는지(오브젝트 점)'와 '어느 방향으로 갈 수 있는지(어포던스 점)'를 이미지 위의 점으로 찍는 이중 포인팅을 과제·로봇 공용 인터페이스로 쓰고, 행동은 언어모델 헤드의 토큰 3개로 10개 웨이포인트를 뽑는 RVQ 토크나이저가 만든다. 2K+ 씬·4K+ 시간 데이터로 미드트레이닝-SFT-RL을 거쳤고, 10개 공개 시뮬레이션 전부에서 단안 카메라 기준 최고 성공률을 냈다. 실제 휴머노이드·4족·드론·바퀴 로봇에 추가 학습 없이 그대로 옮겨갔다.
핵심 요약
- 과제별 예측 헤드 없이 VLM 백본 하나로 안내 따르기, 열린 어휘 물건 탐색, 시각 추적을 한 모델로 처리했다.
- 이중 포인팅(어포던스 점+오브젝트 점)이 평균 성공률을 54.7%에서 63.1%로 끌어올렸고, 제거 시 모든 벤치마크에서 성능이 떨어졌다.
- 잔차 벡터 양자화(RVQ) 행동 토크나이저로 토큰 3개만으로 10개 웨이포인트 궤적을 정밀 생성했다.
- 10개 공개 내비게이션 시뮬레이션 전부에서 단안(monocular) 성공률 최고치를 기록했다.
- 휴머노이드·4족·공중·바퀴 로봇에 제로샷 전이됐고, 환경 다양성 확대가 모델 크기 증가보다 확실한 성능 축이었다(백본은 4B 이상에서 포화).
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.