HelloWorld: Enabling Socially Interactive Characters in Video World Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 828
- 분야
- Computer Vision
- arXiv 번호
- 2608.05070
비디오 월드 모델에서 사용자가 버튼을 누르면 캐릭터가 사용자를 향해 인사하거나 말을 거는 사회적 상호작용을 가능하게 만들었다.
이 논문은 한마디로 AI가 만드는 비디오 세계 안의 캐릭터가 사용자와 눈을 맞추고 인사하는 기술이다. HelloWorld는 자가 증류(self-distillation) 파이프라인으로, 기존 비디오 생성 모델이 만든 상호작용 영상을 학습 데이터로 재활용한다. 추론 때는 훈련 없이 크로스 어텐션 마스크만으로 상호작용 시점을 정밀하게 제어한다. HelloWorldBench라는 최초의 사회적 상호작용 벤치마크(400샘플)도 구축했다.
핵심 요약
- 비디오 월드 모델에서 캐릭터-사용자 간 사회적 상호작용(손흔들기, 인사, 말걸기)을 최초로 구현했다.
- 기존 모델이 자체 생성한 상호작용 영상을 학습 데이터로 재활용하는 self-distillation 파이프라인을 제안했다.
- 훈련 없이 크로스 어텐션 마스크만으로 상호작용 발생 시점을 프레임 단위로 정밀 제어한다.
- 최초의 사회적 상호작용 벤치마크 HelloWorldBench(400샘플, 3가지 상호작용 지표)를 구축했다.
- 기존 월드 모델들을 상호작용 품질에서 크게 앞서며 영상 미학과 카메라 추종에서도 SOTA 수준을 유지했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.