FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

발행일
출처
arXiv
논문 번호
997
분야
Computer Vision
arXiv 번호
2608.23549

이 논문은 3D 렌더링 영상의 흔한 결함(떠다니는 점, 흐림, 구멍)을 표현별 전용 모델 없이 사전학습 영상 생성모델 하나로 모두 고치는 범용 정화기를 만들었다.

이 논문은 한마디로 '3D 렌더링 수리공' 역할을 하는 범용 비디오 모델이다. 3DGS·NeRF·메쉬·포인트클라우드 등 어떤 표현이든, 결함 있는 렌더링 영상을 자연스러운 영상으로 번역하듯 정화한다. 사전학습 영상 모델(Wan2.1)에 LoRA만 얹어 파라미터 1% 미만을 고쳤고, 쌍 훈련 영상 20개만으로도 효과가 났다. 3D 일관성은 카메라 포즈 정확도를 보상으로 쓰는 DPO로 구워 넣어 7.2% 끌어올렸다.

핵심 요약

  • 3DGS·NeRF·메쉬·포인트클라우드 4종 표현의 렌더링 결함을 한 모델로 정화하는 범용 프레임을 제안했다.
  • 다만 입력 시점에 보이지 않던 영역은 모델이 새로 지어내야 해서, 논문의 불확실성 분석에서도 확신이 높은 픽셀 25%는 PSNR 25.7dB, 확신이 낮은 25%는 14.4dB로 품질이 크게 갈렸다.
  • 깨끗한 픽셀을 가리는 마스크 조건으로 신뢰할 프레임과 고칠 프레임을 구분해 환각을 막았다(마스크 제거 시 -1.3dB).
  • 카메라 포즈 복원 정확도를 보상으로 Flow-DPO를 적용, 3D 일관성(AUC@5°)을 7.2% 올렸다.
  • 전문가 파이프라인과 동등 이상 품질이면서, 더 강한 영상 모델이 나오면 갈아끼우기만 하면 되는 구조다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)