Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization

발행일
출처
arXiv
논문 번호
264
분야
Machine Learning
arXiv 번호
2605.28109

Information Bottleneck-driven Tree-based Policy Optimization(IB-TPO)은 대규모 언어 모델을 위한 온라인 강화학습에서 탐색-활용 불균형 문제를 다룬다.

IB-TPO는 온라인 강화학습에서 언어 모델이 새로운 풀이를 탐색하는 정도와 정답 신호를 활용하는 정도의 균형을 맞추는 방법이다. 단계별 추론 다양성과 정답 사이의 상호정보량을 함께 반영하는 IB-Score를 만들어 기존 GRPO의 학습 불균형을 진단한다. 이 점수를 세밀한 최적화 목표로 사용하고, 유용한 분기 지점에서만 트리를 확장해 같은 접두부와 KV 캐시를 재사용한다. 그 결과 같은 토큰 예산에서 독립 샘플링보다 궤적을 50% 더 만들었고 표준 벤치마크에서 GRPO보다 2.9%에서 3.6% 높은 성능을 보고했다. 이는 불확실성만 키우는 탐색이 아니라 정답과 연결된 다양성이 있는 단계에 계산을 집중하는 강화학습 설계가 더 효율적일 수 있음을 보여준다.

핵심 요약

  • 효율성: 접두부를 재사용하고 KV 캐싱을 효과적으로 활용하여, 독립 샘플링 대비 동일한 토큰 예산 내에서 더 많은 궤적(더 높은 G)을 생성할 수 있게 한다.
  • 적응형 탐색: IB-Score를 기준으로 분기함으로써, 모델은 높은 다양성과 정답을 향한 강한 신호가 모두 존재하는 '핵심' 단계에 탐색을 집중한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)