You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories
- 발행일
- 출처
- arXiv
- 논문 번호
- 208
- 분야
- Machine Learning
- arXiv 번호
- 2605.21468
이 논문은 검증 가능한 보상을 활용한 강화학습(RLVR) 훈련 과정에서 LLM 파라미터 궤적이 저랭크이며 선형적인 특성을 보인다는 점을 밝혀낸다.
이 연구는 검증 가능한 보상을 쓰는 강화학습에서 모델 가중치의 이동 경로가 매우 낮은 랭크로 나타나는 현상을 분석했다. 성능 향상의 대부분은 파라미터 변화의 랭크 1 근사로 설명되며, 그 크기는 학습 단계에 따라 거의 선형으로 변했다. RELEX는 짧은 초기 학습 구간에서 이 한 방향을 추정한 뒤 선형 회귀로 미래 체크포인트를 계산해 추가 강화학습 비용을 줄인다. 세 가지 모델에서 전체 학습 단계의 15퍼센트만 관찰하고도 원래 강화학습과 비슷하거나 더 나은 내부 및 외부 분포 성능을 보였고, 관찰 구간보다 10배에서 20배 먼 단계까지 확장했다. 분석은 랭크를 늘리거나 비선형 모델을 쓰는 이득이 없었으며, 랭크 1 투영이 확률적 최적화 잡음을 줄이는 효과가 핵심이라고 설명한다.
핵심 요약
- 이 논문은 RLVR 가중치 궤적이 극도로 저랭크이며 매우 예측 가능하다는 점을 입증한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.