SuperNav: An Agentic Navigation System for Any Task in Any Scene
- 발행일
- 출처
- arXiv
- 논문 번호
- 1176
- 분야
- Robotics
- arXiv 번호
- 2610.12126
사전학습된 멀티모달 LLM을 내비게이션용으로 추가학습하지 않고, 전용 에이전트 하네스(도구+스킬)만 얹혀 어떤 장소·요청이든 내비게이션하게 한 시스템이다.
이 논문은 한마디로 범용 서비스 로봇이 낯선 환경에서 온갖 요청을 처리하게 하는 에이전트형 내비게이션 시스템이다. 저자들은 MLLM(이미지와 글을 같이 이해하는 모델)은 요청 해석·장면 이해·판단만 맡기고, 실제 이동은 내비게이션 도구에 위임하는 전용 하네스를 설계했다. 모델이 이미지 위에서 목적지를 직접 지정하는 '시각적 점 인터페이스'로 판단과 이동을 연결했다. 그 결과 단일 객체 내비게이션 78.00%, 수요 기반 내비게이션 59.50% 성공으로 각각 최강 baseline(34.00%, 37.50%)을 크게 앞섰고, 실제 4족 로봇 배포까지 확인했다.
핵심 요약
- 내비게이션에 특화된 추가학습 없이, 사전학습 MLLM에 전용 에이전트 하네스를 얹는 것만으로 일반화를 확보했다.
- 모델은 이미지에서 목적지 점을 직접 찍는 시각적 점 인터페이스로 이동을 지시하고, 실행 피드백으로 판단을 수정한다.
- 단일 객체 내비게이션 78.00% 성공으로 최강 baseline(UniNaVid 34.00%)을 44%p 앞질렀다.
- 훈련·적응 없이 HM3D-OVON 120 에피소드에서 73.33% 성공률을 기록했다.
- 시뮬레이션뿐 아니라 실제 4족 보행 로봇 배포로 실환경 적용 가능성을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.