DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

발행일
출처
arXiv
논문 번호
022
분야
Reasoning / RL
arXiv 번호
2501.12948

DeepSeek-AI는 사람이 주석한 추론 궤적에 의존하지 않고 순수한 결과 기반 강화학습을 통해 정교한 추론 능력이 발현될 수 있음을 보여주는 LLM인 DeepSeek-R1을 개발했다.

DeepSeek-AI는 사람이 주석한 추론 궤적에 의존하지 않고 순수한 결과 기반 강화학습을 통해 정교한 추론 능력이 발현될 수 있음을 보여주는 LLM인 DeepSeek-R1을 개발했다. 이 모델은 R1-Zero로 AIME 2024 pass@1 정확도 77.9%를 달성했으며, 다단계 DeepSeek-R1은 수많은 수학·코딩·STEM 벤치마크에서 SOTA 모델을 능가하는 동시에 창발적 자기 성찰과 동적 전략 적응을 보였다.

핵심 요약

  • 기존 LLM 추론 방법은 노동 집약적인 사람 주석 데이터에 크게 의존하여 확장성 문제와 인간 인지 편향의 유입을 초래한다.
  • 사람의 추론 경로를 모방하도록 모델을 학습시키면 성능에 상한이 생기고 잠재적으로 더 우수한 비인간적 전략의 탐색이 가로막힌다.
  • 추론 과제에 대한 초기 지도 미세조정 없이, 강력한 베이스 LLM(DeepSeek-V3-Base)에 직접 순수 결과 기반 강화학습 접근법인 DeepSeek-R1-Zero를 적용한다.
  • 가독성을 위한 초기 SFT, 언어 일관성 보상을 동반한 지속 RL, 추론·비추론 데이터를 모두 사용한 2차 SFT를 결합하는 다단계 학습 프레임워크(DeepSeek-R1)를 구현한다.
  • 지식 증류를 활용하여 DeepSeek-R1의 고급 추론 능력을 더 작은 오픈소스 모델로 전이함으로써 더 폭넓은 접근성을 확보한다.
  • 정교한 추론 능력은 명시적인 사람 주석 추론 궤적을 요구하지 않고, 결과 기반 강화학습을 통해 LLM에서 자생적으로 발현될 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)