EchoWM: Open and Enterable Omnimodal World Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 993
- 분야
- Computer Vision
- arXiv 번호
- 2608.23189
이 논문은 사용자가 계속 이동하며 탐험할 수 있는 가상세계를 720p 영상과 환경음·음악·말까지 함께 생성하는 옴니모달 세계모델을 만들었다.
이 논문은 한마디로 '들어갈 수 있는 세계'를 만드는 생성 모델이다. EchoWM은 카메라 의도를 6-DoF 궤적으로 입력받아 1인칭이든 3인칭이든 영상·환경음·음악·음성을 동시에 생성한다. 서로 다른 데이터 소스의 물리 스케일을 맞추고, 4단계 점진 훈련으로 품질과 제어 능력의 충돌을 분리해 학습했다. 공개 세계모델 벤치마크(WBench Navigation)에서 1위를 차지했다.
핵심 요약
- 영상·환경음·배경음악·음성을 한 모델이 동시에 생성하는 옴니모달 세계모델이다.
- 이산 명령과 연속 자세를 공통 6-DoF 궤적으로 통일해 1인칭/3인칭을 별도 컨트롤러 없이 다룬다.
- AV 사전학습→제어 학습→통합 파인튜닝→자기회귀 후속학습 4단계로 품질-제어 충돌을 풀었다.
- 공개 벤치마크 WBench Navigation 1위, SANA-WM-Bench에서도 최상위 품질을 기록했다.
- 다만 지속적인 3차원 기억이 없어서, 여러 번 이어서 생성하면 장면 구조와 인물, 소리가 조금씩 어긋날 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.