CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 569
- 분야
- Machine Learning
- arXiv 번호
- 2607.05378
컨텍스트 압축을 RL 훈련에 통합하여 장기 호라이즌 에이전트의 성능을 향상하는 CompactionRL을 제안한다. GLM-4.5-Air 기반 SWE-bench Verified 66.8%를 달성했다.
CompactionRL은 유한 컨텍스트 윈도우 내에서 장기 호라이즌 에이전트를 훈련하기 위해 컨텍스트 압축을 RL 파이프라인에 통합한다. 토큰 수준 손실 정규화와 교차 궤적 GAE로 요약 품질과 실행 정책을 공동 최적화한다. GLM-4.5-Air(106B-A30B) 기준 SWE-bench Verified 66.8%, Terminal-Bench 2.0 24.5%를 달성하여 각각 +7.0, +3.1점 향상을 기록했다.
핵심 요약
- 컨텍스트 압축(요약)을 RL 훈련 루프에 통합, 요약을 학습 가능한 정책 일부로 만듦
- 토큰 수준 손실 정규화로 세그먼트 길이 편향 보정 + 교차 궤적 GAE로 압축 경계 너머 신용 할당
- GLM-4.5-Air(106B): SWE-bench Verified 66.8%(+7.0), Terminal-Bench 2.0 24.5%(+3.1)
- GLM-4.7-Flash(30B): SWE-bench Verified 56.0%(+5.5), Terminal-Bench 2.0 20.2%(+6.8)
- 요약 훈련 포함 시 요약 길이가 증가하며 더 상세한 압축 상태 생성, 추론 토큰도 증가하여 유효 컨텍스트 확장
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.