Q-Learning With World Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 974
- 분야
- Machine Learning
- arXiv 번호
- 2608.17163
세계 모델(미래를 상상하는 모델)을 학습 데이터원 대신 '행동을 고르는 순간의 탐색'용으로만 써서, Q러닝 강화학습의 샘플 효율과 성능을 끌어올린 방법이다.
이 논문은 한마디로 로봇 강화학습에서 세계 모델을 '훈련 데이터 생성기'가 아니라 '행동 선택 순간의 상상 탐색'으로만 쓴 방법이다. 기존 모델 기반 강화학습은 상상된 궤적 위에서 정책을 직접 훈련하므로 모델의 편향이 누적돼 실제 로봇 문제로 확장이 어려웠다. QWM은 정책과 가치함수를 오직 실제 환경 데이터로만 학습하고, 행동을 고를 때만 세계 모델로 미래를 상상해 후보 행동의 가치를 트리 탐색으로 평가한다. Robomimic과 LIBERO 로봇 조작 벤치마크에서 샘플 효율과 성능 모두 강력한 기존 방법을 앞질렀다. 탐색 깊이 2와 짧은 미래 가중치(람다=0.2)가 최적이었고, 픽셀(이미지) 관측 설정에서도 우위를 확인했다.
핵심 요약
- 세계 모델을 훈련 데이터원으로 쓰지 않고 오직 행동 선택 시점의 트리 탐색에만 써서, 상상 궤적의 편향 누적 없이 샘플 효율 이득을 얻었다.
- 정책과 Q함수는 실제 환경 데이터로만 학습하므로 세계 모델의 오차가 학습 과정에 스며들지 않는다.
- 로봇 조작 벤치마크 Robomimic과 LIBERO에서 강력한 선행 방법들을 샘플 효율과 최종 성능 모두에서 유의미하게 앞질렀다.
- 탐색을 학습 데이터 수집과 평가 양쪽에 모두 적용할 때 가장 일관된 향상을 보였고, 깊이 2의 얕은 탐색과 짧은 미래 가중치(람다=0.2)가 최적이었다.
- 이미지 관측(픽셀 기반) 설정에서도 기본 알고리즘 대비 전반적으로 빠른 학습과 높은 성공률을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.