PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives
- 발행일
- 출처
- arXiv
- 논문 번호
- 902
- 분야
- Computer Vision
- arXiv 번호
- 2608.13552
월드모델을 사람 게이머처럼 장기 목표로 플레이하며 평가하는 벤치마크. 지속 상태 진화가 최대 약점임을 드러냄.
이 논문은 한마디로 월드모델을 고정된 액션 순서가 아니라 '360도 돌아보기' 같은 장기 목표로 플레이하며 평가하는 벤치마크다. 멀티모달 에이전트 플레이어가 화면을 보며 액션을 조절(연장/정지/수정)해서, 모델마다 액션 단위가 달라도 공정하게 비교한다. 171개 시나리오에서 9개 최신 월드모델을 평가한 결과 Genie 3가 종합 1위였지만, 모든 모델에서 보이지 않는 영역의 상태 진화가 가장 약했다.
핵심 요약
- 고정 액션 궤적 대신 공유 목표 + 에이전트 플레이어의 적응적 조절(Keep/Stop/Extend/Correct/End)로 모델 간 공정 비교를 가능하게 했다.
- 기하 일관성·상호작용 충실도·시야 외 진화·통찰 진화 4개 핵심 차원과 기본 능력 지표를 함께 평가한다.
- 9개 모델 중 Genie 3가 종합 최고였고 HappyOyster가 2위였다.
- 모든 모델에서 시야 밖 상태 진화와 통찰 진화 점수가 가장 낮아 장기 지속성이 현재 병목임을 확인했다.
- 자동 VQA 메트릭과 인간 선호의 순위가 양의 상관을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.