Qwen-AgentWorld: Language World Models for General Agents

발행일
출처
arXiv
논문 번호
480
분야
World Models / Agents
arXiv 번호
2606.24597

언어 모델 기반 월드 모델로 7개 도메인의 에이전트 환경을 시뮬레이션하고, 분리형 시뮬레이터와 통합형 에이전트 파운데이션 모델 두 패러다임을 제시한다.

Qwen-AgentWorld는 언어 모델 기반 월드 모델을 사용하여 에이전트 환경 시뮬레이션의 경계를 확장한다. 3단계 훈련 파이프라인(CPT→SFT→RL)으로 10M+ 환경 상호작용 트래젝토리에서 Qwen-AgentWorld-35B-A3B와 Qwen-AgentWorld-397B-A17B를 개발했으며, 7개 도메인을 아우르는 에이전트 환경 시뮬레이션이 가능하다. 이 시스템은 분리형 환경 시뮬레이터로 수천 개 환경에서 RL 에이전트 훈련을 지원하거나 통합형 에이전트 파운데이션 모델의 워밍업으로 활용되어 7개 에이전트 벤치마크에서 성능을 개선한다. AgentWorldBench에서 기존 프론티어 모델보다 우월한 성능을 입증했다.

핵심 요약

  • 언어 월드 모델: Qwen-AgentWorld-35B-A3B & Qwen-AgentWorld-397B-A17B, 7개 도메인 시뮬레이션
  • 3단계 훈련: CPT(월드 모델링 능력 주입)→SFT(다음 상태 예측 활성화)→RL(시뮬레이션 정확도 향상)
  • 벤치마크: AgentWorldBench, 5개 프론티어 모델×9개 벤치마크에서 우월한 성능 입증
  • 패러다임 A(분리형): 에이전트 RL용 수천 개 환경 시뮬레이션, 실제 환경 훈련 초과 성능
  • 패러다임 B(통합형): 월드 모델 훈련을 워밍업으로 활용, 7개 에이전트 벤치마크 성능 향상
  • 10M+ 환경 상호작용 트래젝토리 학습, 긴 사고 체인(chain-of-thought) 기반 추론

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)