ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL
- 발행일
- 출처
- arXiv
- 논문 번호
- 1048
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.28476
긴 작업을 하는 에이전트가 자기 대화 맥락(컨텍스트)을 스스로 정리·압축하도록 도구를 늘리고 강화학습으로 가르친 논문.
이 논문은 한마디로 장기 작업 에이전트가 자기 컨텍스트를 능동적으로 관리하도록 훈련시키는 ContextPilot 프레임워크를 제안한 것이다. 기존에는 검색·삭제·요약 세 가지 도구뿐이었는데, 여기에 계획 수립, 장기 기억, 소프트 오프로딩(덜 중요한 내용을 외부 저장소로 내보내기) 도구를 추가했다. 또 컨텍스트 편집 행동마다 영향이 다름을 반영해, 중요한 편집 지점에서 가지치기 샘플링을 하고 행위 단위로 보상을 주는 강화학습을 설계했다. 그 결과 긴 문서 질의응답과 심층 검색 과제에서 더 좋은 성적을 내면서도 컨텍스트 길이를 8~10K 토큰으로 안정적으로 유지했다.
핵심 요약
- 도구 세트에 계획·장기 기억·오프로딩을 추가하자 BrowseComp+ 정확도가 63.49%에서 80.96%로 올랐다.
- 강화학습 적용으로 더 어려운 BrowseComp+ 벤치마크에서 5.34점 상승했다. 과제가 길고 어려울수록 효과가 커졌다.
- 기존 에이전트의 입력 길이는 턴마다 30K 토큰까지 선형 증가했지만, ContextPilot은 8~10K 토큰에서 안정됐다.
- 강화학습이 도구 사용 실수도 줄였다. 초기에 잦던 기억·오프로딩 도구 실패가 훈련되며 크게 감소했다.
- Qwen3-8B/14B, Gemma4-E4B 등 서로 다른 베이스 모델에서도 일관된 향상을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.