CompactionRL: Reinforcement Learning with Context Compaction for Long-Horizon Agents

발행일
출처
arXiv
논문 번호
569
분야
Machine Learning
arXiv 번호
2607.05378

컨텍스트 압축을 RL 훈련에 통합하여 장기 호라이즌 에이전트의 성능을 향상하는 CompactionRL을 제안한다. GLM-4.5-Air 기반 SWE-bench Verified 66.8%를 달성했다.

CompactionRL은 유한 컨텍스트 윈도우 내에서 장기 호라이즌 에이전트를 훈련하기 위해 컨텍스트 압축을 RL 파이프라인에 통합한다. 토큰 수준 손실 정규화와 교차 궤적 GAE로 요약 품질과 실행 정책을 공동 최적화한다. GLM-4.5-Air(106B-A30B) 기준 SWE-bench Verified 66.8%, Terminal-Bench 2.0 24.5%를 달성하여 각각 +7.0, +3.1점 향상을 기록했다.

핵심 요약

  • 컨텍스트 압축(요약)을 RL 훈련 루프에 통합, 요약을 학습 가능한 정책 일부로 만듦
  • 토큰 수준 손실 정규화로 세그먼트 길이 편향 보정 + 교차 궤적 GAE로 압축 경계 너머 신용 할당
  • GLM-4.5-Air(106B): SWE-bench Verified 66.8%(+7.0), Terminal-Bench 2.0 24.5%(+3.1)
  • GLM-4.7-Flash(30B): SWE-bench Verified 56.0%(+5.5), Terminal-Bench 2.0 20.2%(+6.8)
  • 요약 훈련 포함 시 요약 길이가 증가하며 더 상세한 압축 상태 생성, 추론 토큰도 증가하여 유효 컨텍스트 확장

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)