SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

발행일
출처
arXiv
논문 번호
1063
분야
Machine Learning
arXiv 번호
2609.01343

토큰당 계산량·파라미터·KV캐시를 전부 동일하게 맞춘 조건에서도 '중간 레이어만 두 번 반복'하는 구조가 이득인지를 54B 규모 스케일링 법칙으로 검증하고, 같은 성능에 최대 18% 적은 학습 비용을 확인한 논문이다.

이 논문은 한마디로 '레이어 재사용(루핑)이 계산 예산을 공정하게 맞춰도 여전히 이득인가'를 처음으로 다중 규모로 검증한 연구다. 기존 루프 연구는 고정 파라미터에서 반복 횟수만 늘려 계산량 이득과 구조 이득을 섞어 놓았다. 연구진은 전문가 혼합(MoE, 라우터가 토큰마다 일부 전문가만 쓰는 구조) 모델에서 토큰당 연산량·총 파라미터·KV캐시 세 가지를 모두 맞추고, 절제 실험으로 '중간 절반 레이어만 두 번 반복'하는 SMELT 레시피를 찾았다. 54B 규모까지 네 크기에서 스케일링 법칙을 따로 피팅한 결과 SMELT가 모든 규모에서 더 낮은 손실에 도달했고, 같은 성능에 6.8~18.0% 적은 학습 연산량이 들었다. 이득은 코드 도메인에서 가장 크고 입력·예시가 많을수록 커지며, 두 번째 통과에서 어텐션 싱크(문장 첫 토큰 쏠림)가 줄고 근거 토큰으로 시선이 이동하는 것이 원인으로 분석됐다.

핵심 요약

  • 루프 연구 최초로 토큰당 연산량·총 파라미터·KV캐시 세 예산을 동시에 동일하게 맞춰, '계산을 더 써서 그런 것'이라는 반론을 차단한 다중 규모 비교다.
  • 중간 절반 레이어만 두 번 돌리고 은닉 차원을 줄인 뒤 전문가 수를 늘려 지식 용량을 복구하는 설계로, MoE에서만 가능한 예산 균형을 활용했다.
  • 비임베딩 54B까지 4개 규모·여러 희소도에서 항상 더 낮은 손실을 기록했고, 스케일링 법칙 피팅으로 같은 성능 도달에 6.8~18.0% 적은 학습 연산량이 필요함을 확인했다.
  • 코드 도메인에서 이득이 가장 크고, 입력이 길수록 프롬프트의 예시가 많을수록 격차가 벌어져 구조화된 입력에서 루프의 가치가 커짐을 보였다.
  • 두 번째 통과에서 어텐션 싱크가 사라지고 정답 근거 토큰으로 어텐션이 이동하는 현상(괄호 짝맞추기 과제에서 첫 토큰 쏠림 0.60 → 0.02, 근거 토큰 0.24 → 0.85)을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)