Agent-G$^2$: Gaussian Guidance for Agentic Reinforcement Learning

발행일
출처
arXiv
논문 번호
998
분야
AI / General
arXiv 번호
2608.23318

이 논문은 강화학습 훈련 때 전문가 궤적을 얼마나 앞부분까지 보여줄지(힌트 깊이)를 작업별 확률분포로 뽑는 방법으로, 긴 과제 학습 효율을 크게 올렸다.

이 논문은 한마디로 '힌트 주는 양'을 지능적으로 조절한 학습법이다. 전문가 궤적의 앞부분을 보여주는 힌트 기반 강화학습에서는 얼마나 보여줄지가 성패를 가른다. 저자들은 유용한 힌트 깊이가 한 점이 아니라 '띠'를 이룬다는 걸 발견하고, 작업별 가우시안에서 깊이를 뽑아 기존 롤아웃 통계로 온라인 조정했다. ALFWorld에서 1.5B/7B 모델 각각 95.3%/98.4% 성공률로 최강 기준선들을 제쳤다.

핵심 요약

  • 유용한 힌트 깊이가 한 점이 아니라 가우시안형 '띠'를 이룬다는 사실을 진단 실험으로 보였다.
  • 작업 군집별 가우시안(중심+폭)을 기존 롤아웃 통계만으로 온라인 추정해, 추가 롤아웃 없이 깊이를 뽑는다.
  • ALFWorld에서 95.3%(1.5B)/98.4%(7B)로 최강 힌트 기반 기준선을 1.5~2.3점 앞질렀다.
  • WebShop에서 보상 92.3점을 냈고, 이런 결과를 작업별 탐색이 쓰는 롤아웃의 3분의 1도 안 되는 비용으로 얻어 기존 강화학습 파이프라인에 별도 탐색 없이 얹을 수 있다.
  • 다만 학습 과제마다 전문가 궤적이 하나씩 있어야 해서, 그런 시연을 구하기 어렵거나 비용이 큰 환경에는 그대로 적용할 수 없다고 논문은 한계를 밝힌다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)