SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation

발행일
출처
arXiv
논문 번호
913
분야
Computer Vision
arXiv 번호
2608.14138

깊이 지도부터 공간 질문의 답까지, 서로 다른 공간 작업을 한 모델이 같은 지시문으로 처리하게 만든 연구다.

이 논문은 한마디로 3D 복원, 장면 사이 대응점 찾기와 공간 추론을 하나의 7B 멀티모달 모델에서 처리하는 SPARGen을 제안한다. 카메라 자세와 질문 답변처럼 짧고 구조화된 결과는 토큰으로 출력한다. 깊이 지도, 3D 점 지도와 광학 흐름처럼 화면 전체의 값이 필요한 결과는 이미지로 생성한다. 공개 모델 비교에서 여러 공간 작업을 고르게 잘했지만, 일부 3D 복원 지표는 전문 모델보다 낮았다. VAE 이미지 압축은 정밀한 경계와 물리량 표현을 제한한다. 또한 깊이와 점 지도를 상대 크기로 정규화하므로 실제 거리의 절대 크기를 복원하지 못한다.

핵심 요약

  • 기존 시스템은 3D 복원과 공간 질문 답변을 서로 다른 모델이나 별도 모듈로 처리하는 경우가 많았다.
  • SPARGen은 카메라 자세와 텍스트 답변은 토큰으로 만들고, 깊이와 점 지도, 광학 흐름은 이미지처럼 생성한다.
  • 공간 추론, 시각 기하와 광학 흐름 자료를 함께 학습했으며, 64대의 H100 GPU에서 10만 번 학습했다.
  • 공개 모델 비교에서 공간 추론 15개 세부 항목 중 13개가 1위였다. 추가 학습 없이 진행한 KITTI 광학 흐름 평가에서는 EPE 4.09와 F1-all 13.34를 기록했다.
  • 전문 3D 모델 VGGT가 일부 복원 지표에서는 더 좋았다. 정규화된 깊이와 점 지도를 예측하므로 실제 미터 단위의 절대 크기도 알아낼 수 없다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)