Reasoning with Sampling: Your Base Model is Smarter Than You Think
- 발행일
- 출처
- arXiv
- 논문 번호
- 089
- 분야
- Reasoning / Inference
- arXiv 번호
- 2510.14901
Harvard University의 연구진이 Metropolis-Hastings 알고리즘을 활용해 기본 대형 언어 모델의 첨예화된 분포에서 샘플링하는 학습 불필요 방법인 파워 샘플링을 개발했다.
Harvard University의 연구진이 Metropolis-Hastings 알고리즘을 활용해 기본 대형 언어 모델의 첨예화된 분포에서 샘플링하는 학습 불필요 방법인 파워 샘플링을 개발했다. 이 기법은 잠재된 추론 능력을 끌어내어, 다양한 과제에서 강화학습 사후 학습 방법에 필적하거나 이를 능가하는 단일 시도 성능을 달성하면서도 생성 다양성을 보존한다.
핵심 요약
- 강화학습(RL)이 LLM에 근본적으로 새로운 추론 능력을 가르치는지, 아니면 단지 기존의 잠재된 능력을 첨예화할 뿐인지가 불분명하다.
- 현재 RL 기반 LLM 사후 학습 방법은 높은 연산 비용, 선별된 데이터셋에 대한 의존, 외부 검증기의 필요성을 내재한다.
- RL로 사후 학습된 모델은 흔히 '다양성 붕괴'를 겪어, 단일 시도 성능 향상을 위해 다중 시도 추론 성능(pass@k)을 희생한다.
- 기본 LLM의 '파워 분포', 즉 원분포를 지수 α(α≥1)로 거듭제곱한 분포에서 샘플링하며, 이는 원래 분포를 수학적으로 재가중하여 더 높은 우도의 시퀀스를 선호한다.
- 마르코프 연쇄 몬테카를로(MCMC) 기법인 Metropolis-Hastings(MH) 알고리즘을 사용하여 정규화되지 않은 파워 분포에서의 근사 샘플링을 가능하게 한다.
- 반복적이고 블록 단위의 자기회귀적 MCMC 접근법을 도입하여 시퀀스 구간을 점진적으로 정제함으로써, 복잡도를 관리하고 긴 시퀀스 생성의 믹싱 시간을 개선한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.