GenRec: Knowing Where to Reconstruct and Where to Generate
- 발행일
- 출처
- arXiv
- 논문 번호
- 947
- 분야
- Computer Vision
- arXiv 번호
- 2608.17832
새 시점 뷰 생성에서 이미 본 픽셀은 충실히 복원하고 안 본 영역만 상상으로 채우도록 아키텍처와 손실 함수 차원에서 분리한 연구다.
이 논문은 한마디로 새로운 카메라 시점의 장면을 만들 때 원본에서 이미 보인 픽셀은 정확히 복원하고 안 보인 곳만 생성 모델이 상상하도록 분리한 모델이다. 관찰 마스크로 두 영역을 나눠 생성 백본은 전체를 담당하고 별도 복원 가지가 관찰된 픽셀의 디테일만 살린다. 두 경로는 파라미터와 그래디언트를 공유하지 않아 생성 사전 지식이 오염되지 않는다. 세 데이터셋에서 관찰 영역 복원 품질과 미관찰 영역 지각 품질을 모두 잡았고 최강 기준 대비 추론이 두 자릿수 빠르다.
핵심 요약
- 관찰과 미관찰 픽셀을 단일 손실로 함께 학습시키면 정답이 하나뿐인 복원과 여러 답이 가능한 생성이 서로 방해한다는 문제 의식에서 출발했다.
- 단안 깊이 추정으로 원본 픽셀을 목표 시점에 워핑해 관찰 마스크를 만들고 이 마스크가 아키텍처, 손실, 그래디언트 흐름을 모두 제어한다.
- 흐름 정합 백본이 RGB와 장면 좌표 맵을 함께 복원해 시점 간 일관성을 한 번의 샘플링으로 유지한다.
- RealEstate10K 2-뷰 보간에서 PSNR 19.80로 최강 기준 15.70을 크게 앞섰고 Mip-NeRF 360에서도 전 지표 최고였다.
- 추론 시간이 약 11초로 1,200초가량 걸리는 최강 기준보다 두 자릿수 빠르다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.