ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
- 발행일
- 출처
- arXiv
- 논문 번호
- 831
- 분야
- AI / General
- arXiv 번호
- 2608.05102
긴 검색 과제에서 정답에서 역추적해 각 단계의 기여도를 평가하는 학습법으로, 4B 모델이 30B급 검색 에이전트와 맞먹는 성능을 내게 했다.
이 논문은 한마디로 긴 검색 과제에서 모든 단계를 동일하게 취급하지 말고 정답에서 역추적해 단계별 기여도를 매기자는 연구다. 기존에는 최종 정답만 맞/틀림으로 학습했지만, ABSeeker는 정답에서 필요한 힌트(clue)를 역으로 복원한 뒤 각 검색 단계를 평가한다. 이 단계별 점수로 SFT와 GRPO를 모두 개선했다. 4B 모델로 BrowseComp 55.3%, 30B급 에이전트와 맞먹는 성능을 달성했다.
핵심 요약
- 정답에서 역추적해 중간 힌트(clue)를 복원하고 각 검색 단계를 이 힌트 대비로 평가하는 ABC 프레임워크를 제안했다.
- 실패한 궤적의 유용한 단계도 보상하고 성공한 궤적의 불필요한 단계는 벌점을 주는 정밀 크레딧 할당이 핵심이다.
- ABC-SFT는 단계별 손실 가중치를, ABC-GRPO는 단계별 보상을 사용해 기존 SFT/GRPO를 모두 개선한다.
- 4B 모델로 BrowseComp 37.3→55.3%, BrowseComp-ZH 39.1→52.9%로 같은 규모에서 최고 성능을 달성했다.
- 8.5K 예제만으로 학습해 xbench, GAIA 등 다른 벤치마크로도 잘 일반화되었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.