Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence
- 발행일
- 출처
- arXiv
- 논문 번호
- 624
- 분야
- Computer Vision
- arXiv 번호
- 2607.12477
UAV 자아인식/공간인지 통합 평가 SIS-Bench(4,856 QA) 및 motion-aware 모델.
1,646개 실제 UAV 비디오(14.9시간)에서 13개 과제 4,856 QA를 구축하고 dual-expert 검증을 거쳤다. 공간 인지(self)와 자아 인식(space) 2축에 perception/memory/reasoning 3계층을 교차시킨 평가 체계를 제안했다. GPT-5.4, Gemini-3-Flash 등 최고급 MLLM도 자아 인식에서 인간 대비 큰 격차를 보였으며 특히 reasoning(경로 계획)에서 random 이하 성능이 빈번했다. SIS-Motion(optical flow + visual feature fusion)은 SIS-Bench 전반을 개선하고 downstream UAV navigation 92.2%(baseline 71.2%)로 전이되었다.
핵심 요약
- SIS-Bench는 공간과 자기 인식의 두 축을 지각, 기억, 추론의 세 단계와 교차해 UAV의 자기-공간 이해를 평가한다.
- 전문가 검증을 거쳐 실제 UAV 영상 1,646개에서 13개 과제와 질문·답변 4,856쌍을 만들었다.
- 현재 MLLM은 공간 인지보다 자기 인식이 약했고 지각에서 기억과 추론으로 갈수록 성능이 계속 낮아졌다.
- 광학 흐름과 시각 특징을 결합한 SIS-Motion은 두 축의 지각·기억과 후속 UAV 의사결정 성능을 개선했다.
- 평가는 주로 영상 기반 질문·답변에 머물며 여러 센서를 통합해 실제로 장시간 자율 비행하는 에이전트까지 다루지는 않는다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.