Scaling World-Model Reinforcement Learning Through Diffusion Policy Optimization
- 발행일
- 출처
- arXiv
- 논문 번호
- 255
- 분야
- Machine Learning
- arXiv 번호
- 2605.26282
MBDPO는 월드 모델 내에서 탐색과 정책 최적화를 diffusion 과정으로 통합하여 기존 model-based RL의 구조적 정렬 문제를 해결하는 프레임워크다.
MBDPO(Model-Based Diffusion Policy Optimization)는 월드 모델 기반 강화학습에서 탐색과 가치 학습 간의 구조적 불일치 문제를 해결하기 위해, 정책 최적화를 잠재 월드 모델 상의 diffusion 과정으로 재정식화한다. 암시적 에너지 함수로 데이터셋의 행동 분포에 정책을 고정하면서, 상상 궤적을 통해 score field를 정정하여 최적 Gibbs 정책으로 수렴시킨다. 다중 태스크 오프라인 사전학습·온라인 학습·오프라인-투-온라인 미세조정 전반에서 일관된 성능 향상을 보였으며, 모델 용량이 증가함에 따라 단조적 성능 개선을 달성했다.
핵심 요약
- 월드 모델 기반 RL의 핵심 병목인 탐색-가치 학습 간 구조적 불일치(misalignment) 식별
- 정책 최적화를 잠재 월드 모델 상의 diffusion process로 재정식화하여 탐색과 정책 최적화 통합
- 데이터셋이 유도하는 암시적 에너지 함수(KL trust region)로 정책을 행동 분포에 고정
- 상상 궤적의 누적 보상으로 score field를 정정하여 최적 Gibbs 정책으로 수렴
- 다중 태스크 오프라인 사전학습·온라인·오프라인-투-온라인 설정 전반에서 일관된 성능 향상
- 모델 용량 증가에 따른 단조적 성능 개선으로 확장성 입증
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.