Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration

발행일
출처
arXiv
논문 번호
154
분야
Agents / Web / Reasoning
arXiv 번호
2604.18131

한 방법은 대규모 언어 모델 에이전트가 추론 중에 외부의 인간 감독이나 보상 없이도 미지의 환경을 자발적으로 탐색하고 구조화된 World Knowledge를 생성하도록 학습시킨다.

한 방법은 대규모 언어 모델 에이전트가 추론 중에 외부의 인간 감독이나 보상 없이도 미지의 환경을 자발적으로 탐색하고 구조화된 World Knowledge를 생성하도록 학습시킨다. 학습 중 결과 기반 보상으로 최적화되는 이 Native Evolution 접근법은 과제 성공률을 최대 19%p 절대 증가시키고 17%의 효율성 향상을 가져왔으며, 자체 생성 지식을 갖춘 더 작은 모델이 보조받지 않는 더 큰 모델의 성능을 능가하도록 했다.

핵심 요약

  • 기존의 자기 진화형 LLM 에이전트는 사전 정의된 과제, 워크플로, 또는 검증된 보상 신호와 같은 외부의 인간 감독에 크게 의존한다.
  • 에이전트는 인간의 호기심 주도 탐색과 달리, 명시적 지시나 보상 없이 새로운 환경에서 진정한 자율성과 자발적 학습을 수행할 능력이 부족하다.
  • 현재 패러다임은 진정한 워크플로 없는, 보상 없는 자기 진화를 가능하게 하기보다는 복잡한 에이전트 오케스트레이션으로 공학적 부담을 전가하는 경우가 많다.
  • 추론 시점에 과제나 보상 없이 에이전트가 환경을 자율적으로 탐색하고 구조화된 World Knowledge(K)로 요약하는, 분리된 에이전트 생명주기인 Native Evolution을 도입한다.
  • 생성된 K의 유용성을 잠재적 다운스트림 과제에서의 성능으로 측정하는, 학습 중에만 사용되는 결과 기반 보상 함수를 개발한다.
  • 메타 진화 행동을 내재화하기 위한 지도 미세조정(SFT)에 이어, 탐색 및 정보 관리 전략을 최적화하기 위한 강화 기반 거부 샘플링(RFT)을 수행하는 2단계 학습 프레임워크를 사용한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)