Emergent Hierarchical Reasoning in LLMs through Reinforcement Learning

발행일
출처
arXiv
논문 번호
079
분야
Reasoning / RL
arXiv 번호
2509.03646

이 연구는 강화학습 과정에서 대규모 언어 모델에 창발하는 계층적 추론 구조를 밝혀내며, 초기에 절차적 통합이 이루어진 후 전략적 계획 탐색이 뒤따른다는 점을 보인다.

이 연구는 강화학습 과정에서 대규모 언어 모델에 창발하는 계층적 추론 구조를 밝혀내며, 초기에 절차적 통합이 이루어진 후 전략적 계획 탐색이 뒤따른다는 점을 보인다. 또한 고수준 계획 토큰에 최적화 노력을 집중하여 추론 성능을 향상시키는 알고리즘인 Hierarchy-Aware Credit Assignment(HICRA)를 도입한다.

핵심 요약

  • 경험적 성공에도 불구하고, 강화학습(RL)이 LLM의 복잡한 추론을 어떻게 개선하는지에 대한 메커니즘적 이해는 불투명한 채로 남아 있었다.
  • '아하 모먼트'와 '길이 스케일링' 효과 같은 RL 훈련 중의 의문스러운 현상들은 통합적인 설명이 부족했다.
  • 기존 RL 알고리즘은 생성된 모든 토큰에 무차별적으로 최적화 압력을 가하는 경우가 많아 비효율적인 학습을 초래한다.
  • LLM이 생성한 토큰을 고수준 계획 토큰(예: 논리적 책략)과 저수준 실행 토큰(예: 계산)으로 기능적으로 분해했다.
  • 주관적인 수작업 주석을 피하면서 계획 토큰을 경험적으로 식별하는 데이터 기반 방법인 'Strategic Grams(SGs)'를 도입했다.
  • 식별된 계획 토큰에 대한 어드밴티지 신호를 증폭하여 최적화를 집중시키는 RL 알고리즘인 Hierarchy-Aware Credit Assignment(HICRA)를 개발했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)