Motif 3: Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 862
- 분야
- AI / General
- arXiv 번호
- 2608.09119
이 논문은 314B 총매개변수(토큰당 13.2B 활성)의 세밀한 전문가 MoE 언어모델(Motif 3)을 만들고, 새로운 어텐션 구조(GDLA)와 다중 교사 증류로 오픈웨이트 모델 중 최고 수준의 성능을 달성했다.
이 논문은 한마디로 314B 매개변수 중 토큰당 13.2B만 쓰는 세밀한 MoE(전문가 혼합) 언어모델을 만들었다. 핵심 혁신은 Grouped Differential Latent Attention(GDLA)으로, 노이즈 억제 능력은 유지하면서 KV 캐시를 대폭 줄인다. 12.5조 토큰으로 사전학습하고 7명의 전문가 교사로부터 증류받아 추론·코딩·도구사용·장문 이해에서 오픈웨이트 최고 수준을 기록했다.
핵심 요약
- 384개 전문가 중 토큰마다 8개만 선택하는 초세밀 MoE 구조로 용량은 늘리고 연산은 줄였다.
- Grouped Differential Latent Attention(GDLA)으로 노이즈 억제와 KV 캐시 압축을 동시에 달성했다.
- 12.5조 토큰으로 사전학습하고 다중 교사 온폴리시 증류(MOPD)로 다양한 능력을 하나로 통합했다.
- 256K 컨텍스트 길이를 지원하며 MXFP8 정밀도로 대규모 학습을 안정화했다.
- 오픈웨이트 모델 중 에이전트 과제, 수학 추론, 과학 지식에서 경쟁력 있는 성능을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.