From Zero to Hero: Training-Free Custom Concept Spawning in World Models

발행일
출처
arXiv
논문 번호
289
분야
Computer Vision
arXiv 번호
2606.02575

자기회귀 월드 모델은 대화형 영상 생성을 위한 강력한 패러다임으로 부상하여, 사용자가 동적으로 생성된 환경을 행동을 통해 탐색할 수 있게 한다.

SPAWN은 실행 중인 자기회귀 월드 모델에 사용자가 지정한 인물·물체·건물 같은 개념을 추가하는 학습 없는 방법이다. 이미지-영상 모델의 문맥 메모리 첫 슬롯이 모든 생성 구간의 기준 프레임으로 고정된다는 구조적 특성을 이용한다. 짧은 구간 동안 이 기준을 외부 개념 잠재표현으로 바꿨다가 원래 기준으로 되돌리면, 새 개념이 모델의 메모리를 따라 이후 영상에 전파된다. 실험에서는 이미지나 텍스트로 지정한 개념이 조명·크기·원근에 맞게 들어가고 정체성과 시간 일관성도 유지됐으며, 여러 개념을 차례로 넣는 것도 가능했다. 다만 현재 장면에서 이동 가능한 영역 밖의 위치에는 개념을 생성할 수 없다는 공간적 제약이 남는다.

핵심 요약

  • 이 논문은 개념 스포닝을 위한 학습 불필요 방법 SPAWN(Swapping Pinned Anchor with Windowed iNjection)을 소개한다.
  • SPAWN은 이미지-영상 백본의 구조적 속성을 활용한다. 즉, 컨텍스트 메모리의 첫 번째 슬롯은 참조 프레임에 고정되어 생성되는 모든 청크의 기초 앵커 역할을 한다.
  • 실험은 SPAWN이 정체성과 시간적 일관성을 보존하면서 일관된 조명, 스케일, 원근으로 개념을 통합함을 보여주며, 제어 가능한 개념 스포닝이 어떤 학습도 없이 기존의 자기회귀 월드 모델에서 달성 가능함을 입증한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)