Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization
- 발행일
- 출처
- arXiv
- 논문 번호
- 264
- 분야
- Machine Learning
- arXiv 번호
- 2605.28109
Information Bottleneck-driven Tree-based Policy Optimization(IB-TPO)은 대규모 언어 모델을 위한 온라인 강화학습에서 탐색-활용 불균형 문제를 다룬다.
IB-TPO는 온라인 강화학습에서 언어 모델이 새로운 풀이를 탐색하는 정도와 정답 신호를 활용하는 정도의 균형을 맞추는 방법이다. 단계별 추론 다양성과 정답 사이의 상호정보량을 함께 반영하는 IB-Score를 만들어 기존 GRPO의 학습 불균형을 진단한다. 이 점수를 세밀한 최적화 목표로 사용하고, 유용한 분기 지점에서만 트리를 확장해 같은 접두부와 KV 캐시를 재사용한다. 그 결과 같은 토큰 예산에서 독립 샘플링보다 궤적을 50% 더 만들었고 표준 벤치마크에서 GRPO보다 2.9%에서 3.6% 높은 성능을 보고했다. 이는 불확실성만 키우는 탐색이 아니라 정답과 연결된 다양성이 있는 단계에 계산을 집중하는 강화학습 설계가 더 효율적일 수 있음을 보여준다.
핵심 요약
- 효율성: 접두부를 재사용하고 KV 캐싱을 효과적으로 활용하여, 독립 샘플링 대비 동일한 토큰 예산 내에서 더 많은 궤적(더 높은 G)을 생성할 수 있게 한다.
- 적응형 탐색: IB-Score를 기준으로 분기함으로써, 모델은 높은 다양성과 정답을 향한 강한 신호가 모두 존재하는 '핵심' 단계에 탐색을 집중한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.