R³: 3D Reconstruction via Relative Regression

발행일
출처
arXiv
논문 번호
257
분야
Computer Vision
arXiv 번호
2605.26519

미시간 대학교와 Westlake University의 연구진이 개발한 R3는 직접적인 전역 프레임 회귀에서 학습된 신뢰도 점수를 갖춘 쌍별 상대 자세 회귀로 전환하는 3D 재구성 프레임워크를 도입한다.

R³는 긴 영상의 카메라 자세를 하나의 전역 좌표에서 직접 예측하지 않고 프레임 쌍 사이의 상대 회전과 이동으로 재구성한다. 가벼운 MLP가 상대 자세와 회전·이동별 신뢰도를 예측하며, 이 신뢰도는 학습 손실의 가중치이자 추론 때 여러 쌍을 하나의 궤적으로 합치는 기준이 된다. 같은 체크포인트로 전체 문맥 오프라인 처리와 제한 메모리의 인과적 스트리밍을 모두 지원하고, 스트리밍에서는 신뢰도 기반 키프레임 저장소를 유지한다. 3억7200만 매개변수로 다양한 3차원 과제에서 10억급 모델과 비슷하거나 더 좋은 성능을 냈고 수천 프레임에서도 제한된 메모리로 초당 20프레임 이상을 보고했다. 다만 매우 긴 영상에서는 주기적 재설정이 없으면 누적 오차가 생기고, 먼 시점·가림·장기 시퀀스의 기하 불일치와 수동 임계값 의존이 남아 있다.

핵심 요약

  • 스케일 안정성: 인접한 두 프레임 사이의 상대적 이동(베이스라인)은 보통 작고 예측 가능한 반면, 긴 여정의 시작점으로부터의 거리는 그렇지 않다.
  • 원점 독립성: 시퀀스 내 어떤 프레임도 다른 프레임의 기준이 될 수 있다. 시스템은 더 이상 첫 관측에 '사슬처럼' 묶여 있지 않다.
  • 신규성: 새 프레임의 시각적 특징이 이미 저장된 것과 충분히 다를 경우, 해당 프레임이 뱅크에 추가된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)