Concise Reasoning via Reinforcement Learning

발행일
출처
arXiv
논문 번호
055
분야
Reasoning / Efficiency
arXiv 번호
2504.05185

Wand AI 연구진은 추론 과제에서 흔히 보이는 대규모 언어 모델의 장황함이 더 깊은 추론의 신호가 아니라 최적화 부산물이라는 이론을 제시했다.

Wand AI 연구진은 추론 과제에서 흔히 보이는 대규모 언어 모델의 장황함이 더 깊은 추론의 신호가 아니라 최적화 부산물이라는 이론을 제시했다. 이들은 다양한 수학 및 STEM 벤치마크 전반에서 정확도를 유지하거나 향상시키면서 DeepSeek-R1-Distill 모델의 응답 길이를 40~54% 이상 크게 줄이는 2단계 강화 학습 전략을 개발했으며, 작은 데이터셋으로도 효과적인 학습이 가능함을 입증했다.

핵심 요약

  • 강화 학습(RL)을 통해 추론 과제에 맞춰 강화된 대규모 언어 모델(LLM)은 과도하게 장황한 사고 사슬 출력을 생성하는 경향이 있어 높은 계산 비용과 추론 지연을 초래한다.
  • 추론 정확도를 위해 응답 길이가 필요한지에 대해 기존 문헌에는 상충하는 관찰이 존재하는데, 일부는 더 긴 응답이 정확도를 높인다고 보는 반면 다른 일부는 수익 체감을 발견한다.
  • RL 학습이 응답 길이에 영향을 미치는 근본 메커니즘과, 이러한 장황함이 추론의 본질적 구성 요소인지 아니면 부산물인지는 충분히 이해되지 않았다.
  • 추론을 마르코프 결정 과정(MDP)으로 구성하여, 음의 보상이 어떻게 정책을 장황함으로 이끄는지 규명하기 위해 Proximal Policy Optimization(PPO)과 Generalized Reinforcement Learning with Policy Optimization(GRPO)의 손실 동역학에 대한 이론적 분석을 수행했다.
  • 새로운 2단계 RL 학습 절차를 제안했다. 먼저 어려운 문제에 대한 추론 강화를 위한 초기 단계를 거친 후, 가끔 풀 수 있는 문제로 이루어진 작은 데이터셋에서 간결함을 명시적으로 강제하는 두 번째 단계를 진행한다.
  • 양의 보상이 더 짧은 응답을, 음의 보상이 더 긴 응답을 유도하는 PPO의 고유한 특성(GAE λ가 1보다 작음)을 활용하여, 정확도를 희생하지 않고 모델을 간결함으로 이끌었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)