Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration
- 발행일
- 출처
- arXiv
- 논문 번호
- 154
- 분야
- Agents / Web / Reasoning
- arXiv 번호
- 2604.18131
한 방법은 대규모 언어 모델 에이전트가 추론 중에 외부의 인간 감독이나 보상 없이도 미지의 환경을 자발적으로 탐색하고 구조화된 World Knowledge를 생성하도록 학습시킨다.
한 방법은 대규모 언어 모델 에이전트가 추론 중에 외부의 인간 감독이나 보상 없이도 미지의 환경을 자발적으로 탐색하고 구조화된 World Knowledge를 생성하도록 학습시킨다. 학습 중 결과 기반 보상으로 최적화되는 이 Native Evolution 접근법은 과제 성공률을 최대 19%p 절대 증가시키고 17%의 효율성 향상을 가져왔으며, 자체 생성 지식을 갖춘 더 작은 모델이 보조받지 않는 더 큰 모델의 성능을 능가하도록 했다.
핵심 요약
- 기존의 자기 진화형 LLM 에이전트는 사전 정의된 과제, 워크플로, 또는 검증된 보상 신호와 같은 외부의 인간 감독에 크게 의존한다.
- 에이전트는 인간의 호기심 주도 탐색과 달리, 명시적 지시나 보상 없이 새로운 환경에서 진정한 자율성과 자발적 학습을 수행할 능력이 부족하다.
- 현재 패러다임은 진정한 워크플로 없는, 보상 없는 자기 진화를 가능하게 하기보다는 복잡한 에이전트 오케스트레이션으로 공학적 부담을 전가하는 경우가 많다.
- 추론 시점에 과제나 보상 없이 에이전트가 환경을 자율적으로 탐색하고 구조화된 World Knowledge(K)로 요약하는, 분리된 에이전트 생명주기인 Native Evolution을 도입한다.
- 생성된 K의 유용성을 잠재적 다운스트림 과제에서의 성능으로 측정하는, 학습 중에만 사용되는 결과 기반 보상 함수를 개발한다.
- 메타 진화 행동을 내재화하기 위한 지도 미세조정(SFT)에 이어, 탐색 및 정보 관리 전략을 최적화하기 위한 강화 기반 거부 샘플링(RFT)을 수행하는 2단계 학습 프레임워크를 사용한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.