Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
- 발행일
- 출처
- arXiv
- 논문 번호
- 941
- 분야
- Machine Learning
- arXiv 번호
- 2608.17310
긴 호라이즌 에이전트 파인튜닝에서 강화학습 대신 진화 전략을 쓰면 GPU 메모리를 거의 안 쓰고도 더 잘 된다는 주장이다.
이 논문은 한마디로 에이전트 파인튜닝을 강화학습 대신 진화 전략(ES, 파라미터를 무작위로 흔들어 좋은 방향으로 업데이트하는 기법)으로 하면 긴 과제에서 유리하다는 논증이다. 강화학습은 역전파 때문에 GPU 메모리를 많이 쓰고, 긴 궤적에서 어떤 행동이 성과를 냈는지 계산하기 어렵다. 진화 전략은 순전파만 쓰므로 추론 수준 메모리로도 전체 파라미터를 튜닝할 수 있고 프롬프트·스킬 최적화와도 자유롭게 결합된다. 스도쿠 긴 호라이즌에서 강화학습 대비 12.5% 앞섰고 27B 웹 에이전트도 H100 4장으로 풀 파인튜닝했다.
핵심 요약
- 무작위 매개변수 교란을 순전파로 평가하는 진화 전략을 써서 추론 수준의 GPU 메모리만으로 전체 매개변수를 조정했다.
- 긴 궤적의 보상을 토큰별로 나누지 않고 하나의 정책 교란에 귀속해, 상호작용이 길어질수록 어려워지는 강화학습의 신용 할당을 피했다.
- 15차례 스도쿠에서 강한 GRPO 기준보다 12.5% 높았고, ReAct 수학·문서 질의응답에서도 GRPO보다 평균 8.3% 향상됐다.
- Qwen3.5-27B 웹 에이전트를 H100 네 장으로 전체 미세조정했고, 매개변수와 프롬프트를 함께 바꾼 휴리스틱 탐색은 36개 설정 중 28개에서 기준을 넘었다.
- 교란 크기 같은 추가 조정값이 필요하고 환경 평가가 비싸면 많은 순전파 비용이 불리해지며, 계속 학습할 때 무관한 방향으로 떠도는 문제도 아직 분명하지 않다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.