Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation
- 발행일
- 출처
- arXiv
- 논문 번호
- 949
- 분야
- Robotics
- arXiv 번호
- 2608.17512
VLM 내비게이션에서 픽셀 찍기로 목표를 지정하고 중요한 순간에만 생각하며 압축 기억을 쓰게 학습해 효율과 성능을 같이 잡은 프레임워크다.
이 논문은 한마디로 로봇 내비게이션에서 VLM이 3D 좌표를 직접 출력하는 대신 화면에서 픽셀만 찍게 하고 깊이 정보로 3D로 바꿔 SLAM 컨트롤러에 넘기는 방식이다. VLM의 2D 이미지 사전학습 성질과 자연스럽게 맞아 물어 공간 환각이 줄어든다. 모든 단계가 아니라 핵심 노드에서만 사고를 촉발하고 나머지 궤적은 가벼운 시공간 표시자로 압축해 기억 부담을 줄인다. 결과와 과정 보상을 겹친 2단계 GRPO로 학습해 R2R-CE에서 66.2%로 최고 성능을 냈고 실기계에서도 60.0% 성공률을 보였다.
핵심 요약
- 픽셀-투-3D 행동 정식화로 VLM이 익숙한 2D 시각 프롬프팅만 하게 해 3D 기하 변환 학습에서 오는 공간 환각과 낮은 표본 효율을 피했다.
- 선택적 추론은 핵심 노드에서만 사고를 촉발하고 나머지는 시공간 표시자로 압축해 추론 지연과 기억 오버플로를 함께 관리한다.
- 2단계 GRPO가 전역 결과 보상에 미세 과정 보상을 겹쳐 밀도 있는 감독을 주고 상태에 따라 생각을 촉발하는 적응 능력을 길렀다.
- R2R-CE에서 66.2% 성공률로 최고 성능이었고 학습에 9만 궤적만 필요했다.
- 실물 로봇 무튜닝 배포에서 60.0% 성공률로 StreamVLN 49.0%, DualVLN 53.0%를 앞섰다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.