Concise Reasoning via Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 055
- 분야
- Reasoning / Efficiency
- arXiv 번호
- 2504.05185
Wand AI 연구진은 추론 과제에서 흔히 보이는 대규모 언어 모델의 장황함이 더 깊은 추론의 신호가 아니라 최적화 부산물이라는 이론을 제시했다.
Wand AI 연구진은 추론 과제에서 흔히 보이는 대규모 언어 모델의 장황함이 더 깊은 추론의 신호가 아니라 최적화 부산물이라는 이론을 제시했다. 이들은 다양한 수학 및 STEM 벤치마크 전반에서 정확도를 유지하거나 향상시키면서 DeepSeek-R1-Distill 모델의 응답 길이를 40~54% 이상 크게 줄이는 2단계 강화 학습 전략을 개발했으며, 작은 데이터셋으로도 효과적인 학습이 가능함을 입증했다.
핵심 요약
- 강화 학습(RL)을 통해 추론 과제에 맞춰 강화된 대규모 언어 모델(LLM)은 과도하게 장황한 사고 사슬 출력을 생성하는 경향이 있어 높은 계산 비용과 추론 지연을 초래한다.
- 추론 정확도를 위해 응답 길이가 필요한지에 대해 기존 문헌에는 상충하는 관찰이 존재하는데, 일부는 더 긴 응답이 정확도를 높인다고 보는 반면 다른 일부는 수익 체감을 발견한다.
- RL 학습이 응답 길이에 영향을 미치는 근본 메커니즘과, 이러한 장황함이 추론의 본질적 구성 요소인지 아니면 부산물인지는 충분히 이해되지 않았다.
- 추론을 마르코프 결정 과정(MDP)으로 구성하여, 음의 보상이 어떻게 정책을 장황함으로 이끄는지 규명하기 위해 Proximal Policy Optimization(PPO)과 Generalized Reinforcement Learning with Policy Optimization(GRPO)의 손실 동역학에 대한 이론적 분석을 수행했다.
- 새로운 2단계 RL 학습 절차를 제안했다. 먼저 어려운 문제에 대한 추론 강화를 위한 초기 단계를 거친 후, 가끔 풀 수 있는 문제로 이루어진 작은 데이터셋에서 간결함을 명시적으로 강제하는 두 번째 단계를 진행한다.
- 양의 보상이 더 짧은 응답을, 음의 보상이 더 긴 응답을 유도하는 PPO의 고유한 특성(GAE λ가 1보다 작음)을 활용하여, 정확도를 희생하지 않고 모델을 간결함으로 이끌었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.