MiniMax-01: Scaling Foundation Models with Lightning Attention

발행일
출처
arXiv
논문 번호
017
분야
LLMs / Long Context
arXiv 번호
2501.08313

MiniMax 연구진은 언어 모델에서 선형 어텐션의 첫 대규모 구현에 성공하여, lightning 어텐션과 softmax 어텐션을 결합한 새로운 하이브리드 구조로 최대 4M 토큰까지 대폭 확장된 맥락 창과 함께 SOTA 성능을 달성했다.

MiniMax 연구진은 언어 모델에서 선형 어텐션의 첫 대규모 구현에 성공하여, lightning 어텐션과 softmax 어텐션을 결합한 새로운 하이브리드 구조로 최대 4M 토큰까지 대폭 확장된 맥락 창과 함께 SOTA 성능을 달성했다.

핵심 요약

  • 기존 언어 모델은 짧은 맥락 창(32K~256K 토큰)에 제약된다.
  • 선형 어텐션은 이론적으로 유망하지만 대규모로 성공적으로 구현된 적이 없었다.
  • lightning 어텐션과 softmax 어텐션을 7대 1 비율로 결합한 하이브리드 구조다.
  • 32개 전문가를 갖춘 MoE 모델과 정교한 병렬 연산 전략을 사용한다.
  • 확장된 맥락 길이에 최적화된 다단계 학습 과정을 거친다.
  • 선형 어텐션은 적절한 구현과 최적화를 통해 성공적으로 확장될 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)