Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

발행일
출처
arXiv
논문 번호
703
분야
Computer Vision
arXiv 번호
2607.21594

다중 에이전트가 공유하는 세계 상태를 '레지스터 토큰'으로 명시적으로 관리해서, 서로 다른 시점에서도 일관된 영상을 생성하는 비디오 확산 모델이다.

이 논문은 한마디로 여러 에이전트(게임 속 캐릭터 등)가 같은 세계에서 상호작용할 때, 각자 보는 시각이 달라도 세계 상태가 일관되게 유지되도록 '월드 스테이트 레지스터'라는 학습 가능한 토큰을 도입한 비디오 생성 모델이다. 기존 방식은 과거 프레임만 조건으로 써서 공유 상태를 간접적으로 추론해야 했는데, 이 논문은 상태를 명시적으로 저장하고 업데이트한다. 에이전트 상태, 조감도, 장면 텍스트를 감독 신호로 활용해서 레지스터를 학습한다. Mixture-of-Transformers 구조로 상태 모델링과 프레임 생성을 분리했다.

핵심 요약

  • 월드 스테이트 레지스터(학습 가능한 토큰)로 다중 에이전트 간 공유 상태를 명시적으로 관리한다.
  • 에이전트 상태, 조감도, 장면 텍스트 3종 감독 신호로 레지스터를 그라운딩했다.
  • Mixture-of-Transformers 구조로 상태 업데이트와 프레임 생성 간 간섭을 줄였다.
  • Self-Forcing 패러다임을 적용해 긴 호라이즌 롤아웃 중에 레지스터를 동적 갱신한다.
  • 마인크래프트 2에이전트 실험에서 논리적 일관성과 생성 품질 모두 향상되었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)