Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
- 발행일
- 출처
- arXiv
- 논문 번호
- 542
- 분야
- Machine Learning
- arXiv 번호
- 2607.01232
단일 transformer 레이어만 RL 훈련해도 전체 파라미터 RL 훈련과 맞먹는 성능 향상을 달성한다는 발견. RL 이익이 네트워크 중간층에 집중되는 구조적 패턴을 규명했다.
본 연구는 RL 포스트트레이닝에서 transformer 레이어별 기여도를 체계적으로 분석하여, 단일 레이어 훈련만으로 전체 파라미터 RL 훈련의 성과를 회복할 수 있음을 보여준다. Qwen3, Qwen2.5 등 7개 모델과 GRPO, GiGPO, Dr. GRPO 등 3가지 RL 알고리즘에서 일관되게 중간 레이어의 기여도가 가장 높았으며, 이를 활용한 layer-aware 훈련 전략이 표준 RL을 일관되게 능가했다. 예컨대 Qwen3-8B에서 상위 10개 레이어만 훈련하여 수학 추론 평균 69.1%를 달성, 전체 RL의 66.4%를 초과했다.
핵심 요약
- 단일 transformer 레이어만 훈련해도 최대 114%까지 전체 RL 이익을 회복 가능하며, 최약 레이어는 30% 미만에 불과
- 고기여 레이어는 네트워크 깊이의 약 40-60% 중간층에 일관되게 집중됨 — 모델 스케일·패밀리·RL 알고리즘·데이터셋에 무관
- Layer contribution 순위는 데이터셋 간 Spearman ρ=0.76, 태스크 간 ρ=0.59로 안정적
- 고기여 레이어에 학습률을 높이거나 선택적 훈련을 적용하면 전체 RL 대비 Qwen3-1.7B +43%, 4B +27%, 8B +32% 추가 이익
- 서로 다른 레이어에서 훈련된 모델들은 상호 보완적 행동을 보이며, majority voting으로 추가 성능 향상 가능
- 전체 훈련 시 weight change magnitude는 레이어 간 비교적 균일하나, 기여도는 극단적으로 불균일 → parameter subspace의 효율성 차이가 핵심
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.