ISO: An RLVR-Native Optimization Stack

발행일
출처
arXiv
논문 번호
693
분야
Machine Learning
arXiv 번호
2607.19331

RLVR(검증 가능한 보상으로 강화학습)에서 모델 가중치의 '스펙트럼'은 유지하고 '프레임'만 최적화하는 새 최적화 프레임워크를 제안한 논문이다.

이 논문은 한마디로 RLVR 학습에서 가중치의 특이값 스펙트럼은 베이스 모델 것을 그대로 쓰고, 입력·출력 특이 벡터만 학습하는 ISO 프레임워크를 제안한 것이다. 저자들은 이를 '스펙트럼 상속'이라 부르며, RLVR이 사전학습 최적화 도구를 그대로 물려받는 대신 자체 구조에 맞는 최적화를 설계해야 한다고 주장한다. 오프라인 전문가 병합(ISO-Merger)과 온라인 학습(ISO-Optimizer) 두 가지 버전을 모두 제공한다.

핵심 요약

  • RLVR 학습 후 가중치 스펙트럼은 거의 변하지 않는다는 '스펙트럼 상속' 현상을 발견하고 검증했다.
  • ISO-Optimizer는 Qwen3-8B에서 AdamW와 동일 정확도를 2.7배 적은 스텝(270→100)으로 달성했다.
  • ISO-Merger는 데이터·롤아웃·그래디언트 없이 체크포인트만으로 전문가 모델을 병합한다.
  • 스펙트럼만 고정하고 프레임을 얼리면 성능이 거의 오르지 않아, 양쪽 프레임 모두 학습 가능해야 한다.
  • 1.5B~8B 규모의 추론·코딩 과제에서 일관된 효율 개선을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)