Matryoshka Language Model Suites

발행일
출처
arXiv
논문 번호
874
분야
AI / General
arXiv 번호
2608.09703

이 논문은 여러 크기의 언어모델을 '마트료시카'처럼 하나의 중첩 구조로 학습해서 학습 비용 36% 절감, 추론 효율도 높이는 방법을 제안했다.

이 논문은 한마디로 500M, 1.5B, 3B 세 모델을 따로 학습하지 않고 하나의 중첩된 구조(Matryoshka)로 동시에 학습하는 방법을 제안했다. 작은 모델의 출력이 큰 모델의 입력이 되도록 쌓고, 매 스텝 큰 모델에서 작은 모델로 증류가 자동으로 일어난다. 결과는 개별 학습 대비 36% 적은 연산으로 비슷한 성능을 달성했고, 추상적 추론 속도도 14-26% 빨라졌다.

핵심 요약

  • 여러 크기의 하위 모델을 단일 중첩 구조로 end-to-end 학습하는 Matryoshka 프레임워크를 제안했다.
  • 학습 총 연산을 36% 줄이면서도 독립 학습 대비 동등한 성능과 검증/외부 퍼플렉서티를 달성했다.
  • 가장 큰 모델에서 작은 모델로 매 스텝 무료 증류가 자동으로 이루어진다.
  • 중첩된 드래프트 모델로 추상적 디코딩 처리량을 14-26% 향상했다.
  • 너비/깊이 설정, junction 메커니즘, 증류 손실의 중요성을 광범위한 ablation으로 입증했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)