Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 998
- 분야
- AI / General
- arXiv 번호
- 2608.23318
이 논문은 강화학습 훈련 때 전문가 궤적을 얼마나 앞부분까지 보여줄지(힌트 깊이)를 작업별 확률분포로 뽑는 방법으로, 긴 과제 학습 효율을 크게 올렸다.
이 논문은 한마디로 '힌트 주는 양'을 지능적으로 조절한 학습법이다. 전문가 궤적의 앞부분을 보여주는 힌트 기반 강화학습에서는 얼마나 보여줄지가 성패를 가른다. 저자들은 유용한 힌트 깊이가 한 점이 아니라 '띠'를 이룬다는 걸 발견하고, 작업별 가우시안에서 깊이를 뽑아 기존 롤아웃 통계로 온라인 조정했다. ALFWorld에서 1.5B/7B 모델 각각 95.3%/98.4% 성공률로 최강 기준선들을 제쳤다.
핵심 요약
- 유용한 힌트 깊이가 한 점이 아니라 가우시안형 '띠'를 이룬다는 사실을 진단 실험으로 보였다.
- 작업 군집별 가우시안(중심+폭)을 기존 롤아웃 통계만으로 온라인 추정해, 추가 롤아웃 없이 깊이를 뽑는다.
- ALFWorld에서 95.3%(1.5B)/98.4%(7B)로 최강 힌트 기반 기준선을 1.5~2.3점 앞질렀다.
- WebShop에서 보상 92.3점을 냈고, 이런 결과를 작업별 탐색이 쓰는 롤아웃의 3분의 1도 안 되는 비용으로 얻어 기존 강화학습 파이프라인에 별도 탐색 없이 얹을 수 있다.
- 다만 학습 과제마다 전문가 궤적이 하나씩 있어야 해서, 그런 시연을 구하기 어렵거나 비용이 큰 환경에는 그대로 적용할 수 없다고 논문은 한계를 밝힌다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.