Scaling Laws for Looped Mixture of Experts
- 발행일
- 출처
- arXiv
- 논문 번호
- 1162
- 분야
- efficiency
- arXiv 번호
- 2609.40316
이 논문은 모델 크기를 늘리지 않고 성능을 올리는 두 축(반복 순환, 전문가 희소화)을 하나의 수식으로 함께 예측하는 스케일링 법칙을 처음 세웠다.
이 논문은 한마디로 '되풀이하는 트랜스포머'와 '전문가 분할(MoE)'을 함께 쓸 때 성능이 어떻게 느는지 예측하는 공식이다. 같은 가중치를 여러 번 반복해 쓰면(루프) 파라미터 수는 그대로인데 깊이가 늘어나고, MoE는 쓰는 전문가만 골라 쓰니 총 용량은 크면서 계산은 적다. 저자들은 이 둘을 함께 모델링하는 Loop Scaling Laws를 제안했고, 소형~대형 실험에서 손실 예측이 기존 법칙보다 정확했다. 같은 계산량에서 루프 MoE는 크기가 2배인 일반 MoE와 추론 벤치마크에서 대등했다.
핵심 요약
- 반복(루프)과 희소(MoE)를 따로 보던 기존 연구와 달리, 두 축을 한 법칙으로 묶어 검증 손실을 더 정확히 예측했다.
- 반복 효과는 계속 늘지 않고 포화하며, 전문가 수가 많을수록 그 효과가 더 오래 유지된다는 걸 데이터로 보였다.
- 희소화는 활성 파라미터 효율 약 3배, 반복은 추론에서 총 파라미터 효율 약 2배를 각각 주고, 둘을 합치면 성능 한계가 더 올라간다.
- 조단(1조) 토큰 규모에서도 같은 계산량이라면 루프 MoE가 2배 큰 일반 MoE와 대등해, 메모리·계산 예산 설계의 실무 지침이 된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.