Sample-Efficient Learning from Agent Experience
- 발행일
- 출처
- arXiv
- 논문 번호
- 716
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.21051
에이전트가 환경과 상호작용하며 얻은 경험을 추가 환경 사용 없이 모델 가중치로 증류하는 '경험 증류(Experience Distillation)' 방법을 제안했다.
이 논문은 한마디로 에이전트가 직접 겪은 경험을 모델 가중치에 '증류'해서 경험 없이도 성능을 유지하게 만드는 방법을 제안한다. 핵심 아이디어는 수집된 궤적(trajectory)의 각 시점에서 교사 모델의 다음 행동만 다시 샘플링하는 것이다. 이렇게 하면 추가 환경 상호작용이나 세계 모델 없이도 경험을 가중치로 녹여낼 수 있다. 소프트웨어 엔지니어링 과제 749개와 텍스트 게임 6개에서 실험한 결과, 인컨텍스트 학습(ICL) 효과의 64.8%를 유지했다. 일반 SFT는 3.8%만 회복했다. 강화학습(RL) 대비 환경 샘플을 9.6배 이상 적게 썼다.
핵심 요약
- 에이전트의 상호작용 경험을 가중치로 증류하는 'Experience Distillation' 문제를 정의하고 해법을 제시했다.
- 수집된 궤적의 각 시점에서 교사의 다음 행동만 재샘플링하는 1-step branch rollout로 추가 환경 사용을 없앴다.
- ICL 효과의 64.8%를 유지해서 일반 SFT(3.8% 회복)를 크게 앞섰다.
- 강화학습 베이스라인과 비슷한 성능을 내면서 환경 샘플은 9.6배 이상 적게 사용했다.
- 경험 전처리, 강화된 교사 추론, branch packing 등 실제 구현 디테일을 실험적으로 검증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.