Self-Evolving World Models for LLM Agent Planning

발행일
출처
arXiv
논문 번호
533
분야
AI / General
arXiv 번호
2606.30639

LLM 에이전트용 자가진화 세계 모델. 에피소드 기억+의미 기억+선택적 선견지로 모델 파라미터 변경 없이 예측 정확도와 계획 성공률 향상.

WORLDEVOLVER는 LLM 에이전트의 세계 모델을 배포 시점에서 자가 진화시키는 프레임워크다. 에피소드 기억(검색 기반 시뮬레이션), 의미 기억(예측-관측 불일치에서 규칙 추출), 선택적 선견지(저신뢰 예측 필터링) 세 모듈로 구성된다. 모델 파라미터와 다운스트림 에이전트를 고정한 채 컨텍스트만 수정하여 ALFWorld와 ScienceWorld에서 최고 예측 정확도와 계획 성공률을 달성했다.

핵심 요약

  • 파라미터 업데이트 없이 배포 시점 컨텍스트만 수정하는 자가진화 세계 모델
  • 에피소드 기억: 실제 액션 전환을 검색 기반 시뮬레이션으로 활용
  • 의미 기억: 예측-관측 불일치에서 지속적 휴리스틱 규칙 추출
  • 선택적 선견지: 저신뢰 예측을 에이전트 추론 컨텍스트에 통합하기 전 필터링
  • ALFWorld/ScienceWorld에서 3개 백본 모두 최고 예측 정확도 달성
  • 노이지 선견지는 액션 정확도를 해친다는 오라클 실험 결과 → 신뢰도 필터링의 중요성 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)