Self in Space: Benchmarking Self-Awareness and Spatial Cognition in UAV Embodied Intelligence

발행일
출처
arXiv
논문 번호
624
분야
Computer Vision
arXiv 번호
2607.12477

UAV 자아인식/공간인지 통합 평가 SIS-Bench(4,856 QA) 및 motion-aware 모델.

1,646개 실제 UAV 비디오(14.9시간)에서 13개 과제 4,856 QA를 구축하고 dual-expert 검증을 거쳤다. 공간 인지(self)와 자아 인식(space) 2축에 perception/memory/reasoning 3계층을 교차시킨 평가 체계를 제안했다. GPT-5.4, Gemini-3-Flash 등 최고급 MLLM도 자아 인식에서 인간 대비 큰 격차를 보였으며 특히 reasoning(경로 계획)에서 random 이하 성능이 빈번했다. SIS-Motion(optical flow + visual feature fusion)은 SIS-Bench 전반을 개선하고 downstream UAV navigation 92.2%(baseline 71.2%)로 전이되었다.

핵심 요약

  • SIS-Bench는 공간과 자기 인식의 두 축을 지각, 기억, 추론의 세 단계와 교차해 UAV의 자기-공간 이해를 평가한다.
  • 전문가 검증을 거쳐 실제 UAV 영상 1,646개에서 13개 과제와 질문·답변 4,856쌍을 만들었다.
  • 현재 MLLM은 공간 인지보다 자기 인식이 약했고 지각에서 기억과 추론으로 갈수록 성능이 계속 낮아졌다.
  • 광학 흐름과 시각 특징을 결합한 SIS-Motion은 두 축의 지각·기억과 후속 UAV 의사결정 성능을 개선했다.
  • 평가는 주로 영상 기반 질문·답변에 머물며 여러 센서를 통합해 실제로 장시간 자율 비행하는 에이전트까지 다루지는 않는다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)