LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

발행일
출처
arXiv
논문 번호
1054
분야
Robotics
arXiv 번호
2608.30935

4B 소형 VLM 하나에 '가리키기' 인터페이스를 얹어 과제별 전용 헤드 없이 길찾기·물건 탐색·추적을 전부 처리하게 만든 범용 로봇 내비게이션 모델이다.

이 논문은 한마디로 소형 VLM(Qwen3-VL-4B) 하나를 로봇 내비게이션 만능 두뇌로 만든 것이다. '무엇을 향해 가는지(오브젝트 점)'와 '어느 방향으로 갈 수 있는지(어포던스 점)'를 이미지 위의 점으로 찍는 이중 포인팅을 과제·로봇 공용 인터페이스로 쓰고, 행동은 언어모델 헤드의 토큰 3개로 10개 웨이포인트를 뽑는 RVQ 토크나이저가 만든다. 2K+ 씬·4K+ 시간 데이터로 미드트레이닝-SFT-RL을 거쳤고, 10개 공개 시뮬레이션 전부에서 단안 카메라 기준 최고 성공률을 냈다. 실제 휴머노이드·4족·드론·바퀴 로봇에 추가 학습 없이 그대로 옮겨갔다.

핵심 요약

  • 과제별 예측 헤드 없이 VLM 백본 하나로 안내 따르기, 열린 어휘 물건 탐색, 시각 추적을 한 모델로 처리했다.
  • 이중 포인팅(어포던스 점+오브젝트 점)이 평균 성공률을 54.7%에서 63.1%로 끌어올렸고, 제거 시 모든 벤치마크에서 성능이 떨어졌다.
  • 잔차 벡터 양자화(RVQ) 행동 토크나이저로 토큰 3개만으로 10개 웨이포인트 궤적을 정밀 생성했다.
  • 10개 공개 내비게이션 시뮬레이션 전부에서 단안(monocular) 성공률 최고치를 기록했다.
  • 휴머노이드·4족·공중·바퀴 로봇에 제로샷 전이됐고, 환경 다양성 확대가 모델 크기 증가보다 확실한 성능 축이었다(백본은 4B 이상에서 포화).

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)