HumanNOVA: Photorealistic, Universal and Rapid 3D Human Avatar Modeling from a Single Image
- 발행일
- 출처
- arXiv
- 논문 번호
- 290
- 분야
- Computer Vision
- arXiv 번호
- 2606.02573
이 논문은 단일 RGB 이미지로부터 3D 인간 아바타를 생성하는 사실적이고 범용적이며 빠른 모델인 HumanNOVA를 제시한다.
HumanNOVA는 한 장의 RGB 이미지와 단순화한 인체 메시를 입력받아 3차원 사람 아바타를 빠르게 만드는 피드포워드 모델이다. 연구진은 기존 리깅 자산에 다양한 자세를 적용하고 다중 카메라 촬영 자료를 피팅하는 두 경로로 학습 자산을 10만 개까지 늘렸다. 이미지와 인체 메시를 각각 토큰으로 압축한 뒤 교차 주의로 결합해 트라이플레인 기반 3차원 표현을 만들며, 테스트 시점 최적화 없이 1초 이내에 추론한다. 여러 벤치마크의 정량·정성 평가에서 기존 방법보다 우수한 재구성과 다양한 입력 조건에 대한 견고성을 보고했다. 단일 시점에서 보이지 않는 부분을 복원하는 문제 자체에는 모호성이 남고, 사실적인 사람 재현 기술은 무단 콘텐츠 생성과 사생활 침해에 악용될 위험도 함께 고려해야 한다.
핵심 요약
- 사실성과 일반화를 모두 달성하는 것은 다양하고 고품질인 3D 인간 데이터가 부족하기 때문에 어렵다.
- 이 두 가지 전략을 통해 10만 개의 자산까지 규모를 확장할 수 있으며, 견고한 모델 학습을 위한 데이터의 양과 다양성을 모두 크게 향상시킨다.
- 여러 벤치마크에 대한 광범위한 실험은 정량적으로나 정성적으로 이 접근법의 우수성과 다양한 입력 이미지 조건에서의 견고성을 입증한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.