TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 633
- 분야
- Machine Learning
- arXiv 번호
- 2607.13988
다중 턴 에이전트의 툴 호출 단위 보상 할당을 위한 critic-free 신용 할당 방법.
TRACE는 장기 호라이즌 에이전트 RL에서 턴 단위 보상을 할당하는 critic-free 신용 할당 방법이다. 동결된 참조 모델의 골드 정답 로그 확률을 상태 가치로 변환하고 인접 상태 간 TD 변화를 per-action 보상으로 사용하여, 결과 보상만으로는 학습이 어려운 장기 트래젝토리에서도 효과적인 학습 신호를 제공한다. BrowseComp-Plus에서 Qwen3-4B를 7.2에서 35.6으로, Qwen3-30B-A3B를 8.4에서 42.6으로 향상시켰다.
핵심 요약
- 도구 호출 경계의 상태마다 동결된 참조 모델로 정답 로그확률을 구하고 로그비 상태값의 시간차를 행동별 보상으로 사용한다.
- 별도 비평가나 과정 라벨 없이 결과 보상보다 촘촘한 턴 단위 신용을 제공하며 불필요한 도구 호출 사이에서는 값이 상쇄된다.
- BrowseComp-Plus에서 Qwen3-4B는 7.2에서 35.6으로, Qwen3-30B-A3B는 8.4에서 42.6으로 향상됐다.
- 긴 검색 과정의 유용한 중간 행동을 학습시켜 순수 강화학습의 수렴을 앞당기고 공개 웹 평가로도 행동을 전이했다.
- 현재 값 추정은 짧고 알려진 정답이 있는 검색에 맞춰져 있어 긴 코드 패치나 열린 답변에서는 같은 로그확률 기준이 적절한지 확인되지 않았다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.