OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models

발행일
출처
arXiv
논문 번호
026
분야
Video Generation
arXiv 번호
2502.01061

ByteDance 연구진은 혼합된 다중 모달 조건으로 학습해 인간 애니메이션 모델을 확장하는 Diffusion Transformer 기반 프레임워크 OmniHuman-1을 개발했다.

ByteDance 연구진은 혼합된 다중 모달 조건으로 학습해 인간 애니메이션 모델을 확장하는 Diffusion Transformer 기반 프레임워크 OmniHuman-1을 개발했다. 이 통합 모델은 단일 이미지와 다양한 구동 신호로부터 매우 사실적이고 유연한 인간 비디오를 생성하며, 사실성, 입술 동기화, 제스처 풍부함에서 전문화된 기존 방법들을 능가한다.

핵심 요약

  • 기존의 종단간 인간 애니메이션 모델은 원본 비디오 데이터의 90% 이상을 폐기하는 엄격한 데이터 필터링 요구사항 때문에 대규모 데이터셋으로 효과적으로 확장하기 어렵다.
  • 주요 구동 신호(예: 입술 동기화를 위한 오디오)와 일반적인 신체 동작 사이의 약한 상관관계가 기존 모델을 전문화된 시나리오로 제한해, 전신 애니메이션과 다양한 상호작용을 가로막는다.
  • 현재 모델은 작고 고도로 큐레이션된 데이터셋 탓에 정면 초상화에 정적 배경 같은 좁은 사용 사례에 국한되어 일반화 능력이 제한적이다.
  • 고도화된 Diffusion Transformer(DiT) 구조를 기반으로 구축된 종단간 다중 모달 조건부 인간 비디오 생성 프레임워크 OmniHuman을 제안한다.
  • 약한 조건을 활용해 데이터를 확장하고 강한 조건 대 약한 조건의 학습 비율을 신중하게 균형 잡는, 점진적인 3단계 혼합 조건 방식을 특징으로 하는 새로운 Omni-conditions 학습 전략을 채택했다.
  • 다양한 구동 조건(오디오, 포즈, 텍스트)과 외형 조건(참조 이미지, 모션 프레임)을 최소한의 파라미터 추가로 효율적으로 통합하며, 외형 조건화를 위해 DiT 백본을 재사용한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)