Map-Det3D: Metric Feed-Forward 3D Reconstruction Prior for Multi-view 3D Object Detection from Streaming Inputs

발행일
출처
arXiv
논문 번호
890
분야
Computer Vision
arXiv 번호
2608.12179

이 논문은 연속된 RGB 영상으로 복원한 3D 공간에서 물체 상자를 직접 예측해, 기존 단안 방식보다 CA-1M과 ScanNet200에서 높은 성능을 기록한 Map-Det3D를 제안했다.

이 논문은 한마디로 깊이 센서 없이 여러 RGB 프레임만으로 실제 크기의 3D 물체 상자를 찾는 방법을 제안한다. 기존 방식처럼 화면에서 2D 물체를 먼저 찾고 깊이를 추정하지 않는다. 대신 MapAnything의 3D 복원 기능을 기하 정보 처리기로 사용하고, 짧은 시간 구간의 여러 영상을 합쳐 복원한 3D 공간에서 물체 상자를 직접 예측한다. CA-1M에서 기존 영상 기반 방법보다 높은 성능을 기록했고, 추가 학습 없이 ScanNet200에 적용한 시험에서도 가장 높은 점수를 냈다. 다만 실내 자료로만 학습했고, 물체 종류를 구분하지 않는 탐지에 한정된다.

핵심 요약

  • 짧은 시간 구간의 RGB 프레임을 순서대로 처리하고, 3D 복원 모델이 예측한 크기 비율을 적용해 실제 단위의 물체 상자를 만든다.
  • 2D 탐지 결과를 3D로 바꾸는 단계를 없애고, 여러 시점의 영상에서 얻은 기하 정보를 합친 3D 공간에서 상자를 직접 예측한다.
  • CA-1M에서 한 프레임 기본 구성의 AP15는 11.7이었고 시간 정보와 카메라 정보, 학습 가능한 다중 화면 처리를 모두 사용하면 21.2로 올랐다.
  • 추가 학습 없이 적용한 ScanNet200에서 AP15 15.2를 기록해 기존 단안 방법의 최고값 11.7을 넘었다.
  • CA-1M에서는 기존 단안 및 다중 시점 영상 방법보다 높았지만, 실제 깊이 또는 3차원 점 자료를 쓰는 방법보다는 낮았다. 또한 실내 장면과 물체 종류를 구분하지 않는 탐지에 한정됐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)