Gamma-World: Generative Multi-Agent World Modeling Beyond Two Players
- 발행일
- 출처
- arXiv
- 논문 번호
- 254
- 분야
- Computer Vision
- arXiv 번호
- 2605.28816
Gamma-World는 대화형 시뮬레이션을 위해 설계된 생성형 멀티에이전트 월드 모델로, 순열 대칭적 에이전트 정체성을 위한 Simplex Rotary Agent Encoding과 효율적인 에이전트 간 통신을 위한 Sparse Hub Attention을 도입한다.
Gamma-World는 여러 플레이어나 로봇이 같은 공간에서 동시에 행동하는 영상을 생성하는 멀티에이전트 월드 모델이다. Simplex Rotary Agent Encoding은 각 에이전트에 구별되는 위상을 주면서 순서를 바꿔도 동등하게 취급해 고정 슬롯 정체성 없이 여러 주체를 표현한다. Sparse Hub Attention은 학습 가능한 허브 토큰을 통해 에이전트 사이 정보를 전달해 교차 주의 비용을 에이전트 수의 제곱에서 선형으로 줄인다. 전체 문맥 확산 교사를 KV 캐시를 쓰는 인과적 학생 모델로 증류해 행동에 반응하는 영상을 초당 24프레임으로 생성했다. 멀티플레이 가상 환경에서 슬롯 기반·밀집 주의 기준선보다 영상 품질과 행동 제어, 시점 간 일관성이 좋아졌고 추가 학습 없이 두 명에서 네 명으로 일반화했지만 실제 로봇 환경에서의 성능은 이 평가로 확인되지 않았다.
핵심 요약
- 허브 토큰은 모든 에이전트 토큰과 다른 허브 토큰에 어텐션을 수행한다.
- 양방향 교사 학습: 모델은 우선 전체 시간 시퀀스에 접근할 수 있는 표준 디퓨전 모델로 학습된다. 이 '교사'는 멀티에이전트 상호작용의 전체 분포를 높은 충실도로 학습한다.
- 인과적 학생 학습: 실시간 롤아웃을 가능하게 하기 위해 '학생' 모델은 인과적 구조를 사용해 학습된다. 교사와 달리 학생은 과거와 현재만 본다. Sparse Hub Attention 마스크와 각 프레임 블록마다 독립적으로 샘플링된 노이즈 레벨을 사용한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.