TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

발행일
출처
arXiv
논문 번호
537
분야
Machine Learning
arXiv 번호
2606.32017

에이전트 RL에서 각 행동 세그먼트의 역할(결정적 진전/탐색/무의미/후퇴)을 분류해 역할별 크레딧을 차등 부여하는 프레임워크. GRPO 대비 ALFWorld·WebShop에서 롤아웃 길이를 10~15% 단축하며 성공률을 일관되게 향상시킨다.

TRIAGE는 에이전트 강화학습에서 결과 보상만으로는 불완전한 크레딧 할당 문제를 해결하기 위해, LLM 저지가 각 환경 상호작용 세그먼트를 4가지 역할(결정적 진전, 유용한 탐색, 무의미 인프라, 후퇴)로 분류하고 역할별로 차등 보상을 부여한다. 검증 결과는 최적화 방향으로 유지하되 역할 라벨만으로 MSE-최적 세그먼트 교정이 가능함을 이론·실험으로 보였다. ALFWorld·Search-QA·WebShop에서 GRPO 대비 Qwen3-1.7B 기준 최대 18.4점 성공률 향상을 달성했으며, 완료된 롤아웃의 환경 턴 수도 10.4%~14.8% 추가 감소시켰다. 회귀 패널티가 주요 기여 요인이고 탐색 보너스는 일관된 보조 이득을 제공한다.

핵심 요약

  • 에이전트 RL의 핵심 문제: GRPO는 트라젝토리 성공/실패를 모든 행동에 동일 적용 → 유용한 탐색이 실패 롤아웃에서 벌받고, 후퇴 행동이 성공 롤아웃에서 보상받음
  • 4역할 분류 체계: Decisive(결정적 진전), Exploration(유용한 탐색), No-progress(무의미), Regression(후퇴) — 역할별 차등 크레딧 룰 적용
  • 역할 라벨만으로 MSE-최적 세그먼트 교정 가능함을 증명: judge가 신뢰할 수 있는 한도 내에서 advantage 추정 오차를 항상 감소시킴
  • Qwen3-1.7B에서 ALFWorld 18.4점, WebShop 7.9점 향상; 완료 롤아웃 환경 턴 10.4%~14.8% 감소
  • 회귀 억제가 주요 성능 원인(ALFWorld/WebShop에서 회귀 비율 약 48%/43%), 탐색 보너스는 0.6~1.7점의 일관된 보조 이득
  • 스칼라 프로세스 보상이나 outcome-supervised value baseline보다 우수 → 단순 dense reward 추가가 아닌 역할 타이핑 자체가 효과

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)