DeepLoop: Depth Scaling for Looped Transformers
- 발행일
- 출처
- arXiv
- 논문 번호
- 653
- 분야
- Machine Learning
- arXiv 번호
- 2607.13491
루프 트랜스포머에서 가중치 공유로 인한 잔차 스케일링 문제를 수학적으로 분석하고, 더 안정적인 스케일링 공식을 제안한 논문이다.
이 논문은 한마디로 같은 트랜스포머 층을 여러 번 돌리는 '루프 트랜스포머'에서 안정적으로 학습하기 위한 스케일링 공식을 새로 제안한 연구다. 층을 공유하면 같은 가중치가 여러 번 쓰이면서 기울기가 누적되어 불안정해진다. 저자들은 이 효과를 수학적으로 모델링하고, DeepNorm의 지수를 1/4에서 1/2로 올려야 한다는 것을 보였다. GPT-2 규모에서 루프가 늘어날수록 기존 방식보다 일관되게 성능이 좋아졌다.
핵심 요약
- 층을 공유하는 루프 트랜스포머에서 기울기 누적으로 인해 기존 DeepNorm 스케일링이 불충분하다는 것을 수학적으로 증명했다.
- 지수를 1/4에서 1/2로 올리는 것만으로(α=(2N)^{1/2}, β=(8N)^{-1/2}) 루프가 늘어날 때 학습이 안정화된다.
- GPT-2 small/medium 규모에서 루프 횟수가 늘어날수록 기존 방식 대비 일관된 성능 향상을 보였다.
- ARC-AGI 추론 벤치마크에서 계층적 추론 모델(HRM)에 적용했을 때 정확도가 36.5%에서 39.75%로 올랐다 (+3.25pp).
- 추가 파라미터 없이 스케일링 공식만 바꾸는 것이므로 적용 비용이 거의 제로다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.