HelloWorld: Enabling Socially Interactive Characters in Video World Models

발행일
출처
arXiv
논문 번호
828
분야
Computer Vision
arXiv 번호
2608.05070

비디오 월드 모델에서 사용자가 버튼을 누르면 캐릭터가 사용자를 향해 인사하거나 말을 거는 사회적 상호작용을 가능하게 만들었다.

이 논문은 한마디로 AI가 만드는 비디오 세계 안의 캐릭터가 사용자와 눈을 맞추고 인사하는 기술이다. HelloWorld는 자가 증류(self-distillation) 파이프라인으로, 기존 비디오 생성 모델이 만든 상호작용 영상을 학습 데이터로 재활용한다. 추론 때는 훈련 없이 크로스 어텐션 마스크만으로 상호작용 시점을 정밀하게 제어한다. HelloWorldBench라는 최초의 사회적 상호작용 벤치마크(400샘플)도 구축했다.

핵심 요약

  • 비디오 월드 모델에서 캐릭터-사용자 간 사회적 상호작용(손흔들기, 인사, 말걸기)을 최초로 구현했다.
  • 기존 모델이 자체 생성한 상호작용 영상을 학습 데이터로 재활용하는 self-distillation 파이프라인을 제안했다.
  • 훈련 없이 크로스 어텐션 마스크만으로 상호작용 발생 시점을 프레임 단위로 정밀 제어한다.
  • 최초의 사회적 상호작용 벤치마크 HelloWorldBench(400샘플, 3가지 상호작용 지표)를 구축했다.
  • 기존 월드 모델들을 상호작용 품질에서 크게 앞서며 영상 미학과 카메라 추종에서도 SOTA 수준을 유지했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)