Tapered Language Models

발행일
출처
arXiv
논문 번호
473
분야
Machine Learning
arXiv 번호
2606.23670

언어 모델의 MLP 폭을 깊이에 따라 코사인 감소(tapering)하면 동일 파라미터/연산량에서 perplexity를 일관되게 개선한다.

Tapered Language Models(TLMs)은 모든 현대 언어 모델이 채택한 '균일한 층별 파라미터 할당'을 재검한다. 층별 기여도가 균일하지 않다는 증거에 착안하여, MLP 중간 폭을 깊이에 따라 단조 감소(cosine schedule)시키는 설계 원칙을 제안한다. Transformer, Gated Attention, Hope-attention, Titans 등 4종 아키텍처와 3종 규모(440M~1.3B)에서 일관되게 perplexity와 downstream 벤치마크를 개선했으며, 파라미터나 연산량 추가 없이 무료로 얻는 개선이다.

핵심 요약

  • 층별 MLP 폭을 cosine 감소(예: 1.5×→0.5×)시켜 전면에 용량 집중 → 균일 배분 대비 perplexity 최대 1.84점 개선
  • 4개 아키텍처(Transformer, Gated Attention, Hope-attention, Titans) × 3규모(440M/760M/1.3B)에서 일관된 개선
  • 파라미터 수와 FLOPs 동일하게 유지하면서도 downstream 벤치마크 성능 향상
  • 메커니즘 분석: 깊은 층의 MLP 출력일수록 잔차 스트림과 더 정렬됨(정보 갱신 < 기존 강화)
  • 구조 무관의 범용 설계 레버: 비전 트랜스포머, 디퓨전 등 다른 파운데이션 모델에도 적용 가능

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)