4DAnyone: Create Anyone in 4D from a Casual Monocular Video

발행일
출처
arXiv
논문 번호
961
분야
Computer Vision
arXiv 번호
2608.20335

스마트폰 등으로 대충 찍은 영상 한 개만으로 어느 방향에서든 볼 수 있는 3D 사람 영상(4D 휴먼)을 복원하는 프레임워크다.

이 논문은 한마디로 카메라 1대 영상에서 자유 시점 4D 휴먼을 만드는 방법이다. AI 비디오 생성 모델로 서로 일관된 여러 시점 영상을 만든 뒤, 4D 가우시안 스플래팅(3D 장면을 실시간 렌더링하는 기술)으로 합친다. 시점 수가 수십 개로 늘면 생성 품질이 무너지는 문제를, 참조 화면을 고정 길이로 압축하는 RCP와 시점 그룹을 노이즈 단계별로 재조합하는 TCR로 해결했다. 그 결과 기존 최고 방법보다 화질 점수(PSNR)가 3점 안팎 높고, 통제된 스튜디오 영상이 아닌 야외 일반 영상에서도 잘 작동한다.

핵심 요약

  • 카메라 1대 영상만으로 16개 시점 영상을 일관되게 생성해 4D 휴먼(움직이는 3D 사람)을 복원하는 파이프라인을 만들었다.
  • 참조 화면 압축(RCP)과 시점 그룹 순환(TCR)으로, 시점이 많아져서 생기는 일관성 붕괴 문제를 해결했다.
  • DNA-Rendering·DyMVHumans 벤치마크에서 4D 복원 PSNR 24.15/23.28로 기존 최고 방법(20.55/19.86)을 크게 앞질렀다.
  • 신뢰성 떨어지는 깊이 정보 대신 3D 골격만 조건으로 써서, 카메라 파라미터를 모르는 영상에서도 작동한다.
  • 자체 게임엔진으로 MVGameHuman 학습데이터를 구축해 다양한 야외 영상에서도 견디는 일반화 성능을 확보했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)