Code World Models for General Game Playing
- 발행일
- 출처
- arXiv
- 논문 번호
- 459
- 분야
- Agents / World Models
- arXiv 번호
- 2510.04542
LLM을 정책으로 쓰지 않고 규칙을 Python 코드로 번역해 실행 가능한 세계 모델을 만든 뒤 MCTS로 계획하는 접근법이다.
Google DeepMind의 이 논문은 LLM을 보드게임/카드게임 정책으로 직접 사용하는 대신, LLM이 자연어 규칙과 게임 궤적을 Python 코드 형태의 실행 가능한 세계 모델(CWM)로 번역하게 하는 방법을 제안한다. CWM은 MCTS 같은 고성능 계획 알고리즘의 시뮬레이션 엔진으로 사용되며, LLM이 추가로 생성하는 휴리스틱 가치 함수와 은닉 상태 추론 함수로 보강된다. 특히 불완전 정보 게임에서는 inference 함수와 CWM을 인코더-디코더 구조로 결합하는 '코드 기반 오토인코더' 패러다임을 도입했다. 10개 게임(신규 OOD 게임 4개 포함) 실험에서 CWM 기반 에이전트는 Ground Truth 모델 기반 플레이어와 동등한 성능을 보였고, Gemini 2.5 Pro를 9/10 게임에서 능가했다. LLM의 패턴 매칭에 의존하는 직접 정책 방식의 한계(불법 수, 얕은 전략)를 코드 생성 + 고전적 계획의 조합으로 극복한 것이 핵심 기여다.
핵심 요약
- 핵심 방법은 LLM을 '직접 수를 두는 정책'이 아니라 규칙과 궤적 데이터를 Python 코드로 번역하는 '귀납 엔진'으로 사용하는 것이다. 생성된 Code World Model(CWM)은 상태 전이, 합법 수 열거, 종료 확인 함수를 포함하는 실행 가능한 시뮬레이션 엔진이다.
- CWM 위에 MCTS(완전 정보 게임) 또는 ISMCTS(불완전 정보 게임)를 올려 깊은 탐색 기반 계획을 수행한다. 추가로 LLM에게 휴리스틱 가치 함수와 은닉 상태 추론 함수(inference function)도 코드로 생성하게 한다.
- 불완전 정보 게임을 위해 '코드 기반 오토인코더' 패러다임을 제안한다. inference 함수가 인코더 역할(관측→은닉 상태), CWM이 디코더 역할(은닉 상태→관측)을 하며 게임 규칙이 구조적 정규화기로 작동한다.
- 10개 게임(5개 완전 정보, 5개 불완전 정보, 4개는 논문에서 새로 만든 OOD 게임)에서 평가했다. CWM-MCTS/ISMCTS는 Ground Truth 모델 기반 플레이어와 거의 동등했으며, Gemini 2.5 Pro를 10개 중 9개 게임에서 이기거나 동점을 기록했다.
- 완전 정보 게임에서는 CWM 전이 정확도가 대부분 1.0에 도달했고, 불완전 정보 게임에서는 은닉 상태 추론이 어려운 게임(Gin Rummy)에서 정확도가 52% 수준으로 떨어지는 한계를 보였다.
- 제한점으로는 Gin Rummy처럼 복잡한 규칙의 불완전 정보 게임에서 학습이 어렵고, 오픈 월드/시각 기반 게임으로의 확장이 향후 과제로 남아 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.