Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

발행일
출처
arXiv
논문 번호
542
분야
Machine Learning
arXiv 번호
2607.01232

단일 transformer 레이어만 RL 훈련해도 전체 파라미터 RL 훈련과 맞먹는 성능 향상을 달성한다는 발견. RL 이익이 네트워크 중간층에 집중되는 구조적 패턴을 규명했다.

본 연구는 RL 포스트트레이닝에서 transformer 레이어별 기여도를 체계적으로 분석하여, 단일 레이어 훈련만으로 전체 파라미터 RL 훈련의 성과를 회복할 수 있음을 보여준다. Qwen3, Qwen2.5 등 7개 모델과 GRPO, GiGPO, Dr. GRPO 등 3가지 RL 알고리즘에서 일관되게 중간 레이어의 기여도가 가장 높았으며, 이를 활용한 layer-aware 훈련 전략이 표준 RL을 일관되게 능가했다. 예컨대 Qwen3-8B에서 상위 10개 레이어만 훈련하여 수학 추론 평균 69.1%를 달성, 전체 RL의 66.4%를 초과했다.

핵심 요약

  • 단일 transformer 레이어만 훈련해도 최대 114%까지 전체 RL 이익을 회복 가능하며, 최약 레이어는 30% 미만에 불과
  • 고기여 레이어는 네트워크 깊이의 약 40-60% 중간층에 일관되게 집중됨 — 모델 스케일·패밀리·RL 알고리즘·데이터셋에 무관
  • Layer contribution 순위는 데이터셋 간 Spearman ρ=0.76, 태스크 간 ρ=0.59로 안정적
  • 고기여 레이어에 학습률을 높이거나 선택적 훈련을 적용하면 전체 RL 대비 Qwen3-1.7B +43%, 4B +27%, 8B +32% 추가 이익
  • 서로 다른 레이어에서 훈련된 모델들은 상호 보완적 행동을 보이며, majority voting으로 추가 성능 향상 가능
  • 전체 훈련 시 weight change magnitude는 레이어 간 비교적 균일하나, 기여도는 극단적으로 불균일 → parameter subspace의 효율성 차이가 핵심

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)