LLM Post-Training: A Deep Dive into Reasoning Large Language Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 040
- 분야
- Reasoning / Survey
- arXiv 번호
- 2502.21321
이 논문은 대규모 언어 모델(LLM)의 사후 학습 방법론을 포괄적으로 조사하며, 추론 능력, 사실 정확성, 정렬을 향상시키도록 설계된 기법에 초점을 맞춘다.
이 논문은 대규모 언어 모델(LLM)의 사후 학습 방법론을 포괄적으로 조사하며, 추론 능력, 사실 정확성, 정렬을 향상시키도록 설계된 기법에 초점을 맞춘다. 방법들을 파인튜닝, 강화 학습, 테스트 시점 스케일링으로 체계적으로 분류해 LLM 최적화에서의 역할, 과제, 향후 방향에 대한 구조적 개관을 제공한다.
핵심 요약
- 사전 학습된 대규모 언어 모델(LLM)은 종종 사실 정확성에 어려움을 겪으며 환각이나 논리적으로 일관되지 않은 출력을 생성한다.
- LLM 추론은 명시적 논리 추론보다는 통계적 패턴에 주로 기반하므로 복잡한 추론 작업에서 한계를 보인다.
- 방대한 사전 학습에도 불구하고 LLM은 인간의 의도, 선호, 윤리적 고려와 완전히 정렬되지 않을 수 있어, 신뢰할 수 있는 배포를 위해서는 추가적인 정제가 필요하다.
- 이 논문은 LLM의 기존 사후 학습 방법론을 체계적으로 조사·분류하며 추론 능력 향상에서의 역할에 초점을 맞춘다.
- 기법들을 서로 연결된 세 가지 주요 단계, 즉 파인튜닝(예: instruction, CoT, PEFT), 강화 학습(예: RLHF, DPO, RLAIF), 테스트 시점 스케일링(예: CoT 프롬프팅, Tree-of-Thoughts, MCTS)으로 구성한다.
- 이 조사는 각 기법이 LLM 행동을 정제하고 견고성을 개선하며 다양한 응용에서 적응성을 보장하는 데 기여하는 구체적인 지점을 부각한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.