Déjà View: Looping Transformers for Multi-View 3D Reconstruction
- 발행일
- 출처
- arXiv
- 논문 번호
- 271
- 분야
- Computer Vision
- arXiv 번호
- 2605.30215
DéjàView는 단일한 시간 조건부 블록을 반복적 정제에 재사용하는, 다중 시점 3D 재구성을 위한 루핑 트랜스포머 구조를 제안한다.
DéjàView는 다중 시점 3차원 재구성에서 깊은 트랜스포머의 서로 다른 층을 쌓는 대신 하나의 블록을 여러 번 반복해 예측을 정제한다. 학습할 때 반복 횟수를 범위 안에서 바꾸므로 하나의 체크포인트에서 추론 시간과 품질의 균형을 조절할 수 있다. 실내·실외·물체·주행 장면을 포함한 다섯 벤치마크에서 훨씬 큰 피드포워드 기준선과 비슷하거나 더 좋은 성능을 내면서 매개변수 수와 계산량을 줄였다. 같은 데이터와 계산량에서 단계마다 독립된 매개변수를 둔 모델보다도 반복 블록이 더 좋아, 명시적 반복 자체가 유용한 구조적 편향임을 보여줬다. 그러나 학습 범위를 넘는 반복 횟수로는 안정적으로 외삽하지 못하고, 가변 반복 학습은 같은 예산의 고정 반복보다 품질이 높지 않으며 동적 장면도 직접 처리하지 않는다.
핵심 요약
- 레지스터 토큰: 트랜스포머의 전역 스크래치패드로 사용되는 네 개의 토큰이다.
- 카메라 토큰: 해당 시점의 자세와 내부 파라미터에 관한 정보를 저장하는 특수 토큰이다.
- 프레임 어텐션: 이 하위 블록은 각 이미지에 대해 독립적으로 작동하여, 모델이 단일 시점 내의 국소 기하 구조를 추론할 수 있게 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.