MiniMax-01: Scaling Foundation Models with Lightning Attention
- 발행일
- 출처
- arXiv
- 논문 번호
- 017
- 분야
- LLMs / Long Context
- arXiv 번호
- 2501.08313
MiniMax 연구진은 언어 모델에서 선형 어텐션의 첫 대규모 구현에 성공하여, lightning 어텐션과 softmax 어텐션을 결합한 새로운 하이브리드 구조로 최대 4M 토큰까지 대폭 확장된 맥락 창과 함께 SOTA 성능을 달성했다.
MiniMax 연구진은 언어 모델에서 선형 어텐션의 첫 대규모 구현에 성공하여, lightning 어텐션과 softmax 어텐션을 결합한 새로운 하이브리드 구조로 최대 4M 토큰까지 대폭 확장된 맥락 창과 함께 SOTA 성능을 달성했다.
핵심 요약
- 기존 언어 모델은 짧은 맥락 창(32K~256K 토큰)에 제약된다.
- 선형 어텐션은 이론적으로 유망하지만 대규모로 성공적으로 구현된 적이 없었다.
- lightning 어텐션과 softmax 어텐션을 7대 1 비율로 결합한 하이브리드 구조다.
- 32개 전문가를 갖춘 MoE 모델과 정교한 병렬 연산 전략을 사용한다.
- 확장된 맥락 길이에 최적화된 다단계 학습 과정을 거친다.
- 선형 어텐션은 적절한 구현과 최적화를 통해 성공적으로 확장될 수 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.