You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

발행일
출처
arXiv
논문 번호
208
분야
Machine Learning
arXiv 번호
2605.21468

이 논문은 검증 가능한 보상을 활용한 강화학습(RLVR) 훈련 과정에서 LLM 파라미터 궤적이 저랭크이며 선형적인 특성을 보인다는 점을 밝혀낸다.

이 연구는 검증 가능한 보상을 쓰는 강화학습에서 모델 가중치의 이동 경로가 매우 낮은 랭크로 나타나는 현상을 분석했다. 성능 향상의 대부분은 파라미터 변화의 랭크 1 근사로 설명되며, 그 크기는 학습 단계에 따라 거의 선형으로 변했다. RELEX는 짧은 초기 학습 구간에서 이 한 방향을 추정한 뒤 선형 회귀로 미래 체크포인트를 계산해 추가 강화학습 비용을 줄인다. 세 가지 모델에서 전체 학습 단계의 15퍼센트만 관찰하고도 원래 강화학습과 비슷하거나 더 나은 내부 및 외부 분포 성능을 보였고, 관찰 구간보다 10배에서 20배 먼 단계까지 확장했다. 분석은 랭크를 늘리거나 비선형 모델을 쓰는 이득이 없었으며, 랭크 1 투영이 확률적 최적화 잡음을 줄이는 효과가 핵심이라고 설명한다.

핵심 요약

  • 이 논문은 RLVR 가중치 궤적이 극도로 저랭크이며 매우 예측 가능하다는 점을 입증한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)