Attention to Mamba: A Recipe for Cross-Architecture Distillation

발행일
출처
arXiv
논문 번호
152
분야
LLMs / Architecture / Distillation
arXiv 번호
2604.14191

Apple 연구진은 Pythia-1B Transformer로부터 순수 Mamba 계열 구조로 지식을 전이하기 위해 HedgeMamba라는 2단계 교차 구조 증류 방법을 개발했다.

Apple 연구진은 Pythia-1B Transformer로부터 순수 Mamba 계열 구조로 지식을 전이하기 위해 HedgeMamba라는 2단계 교차 구조 증류 방법을 개발했다. 이 접근법은 교사 모델 원래 사전학습 토큰 예산의 단 2.7%만 사용하면서, Mamba 학생 모델이 교사의 13.86에 근접한 14.11의 퍼플렉서티를 달성하도록 했다.

핵심 요약

  • Transformer 모델은 강력하지만 시퀀스 길이가 늘어남에 따라 2차 계산 비용이 발생하여, 긴 시퀀스와 추론에 대한 효율성이 제한된다.
  • Mamba 같은 상태공간 모델(SSM)을 비롯한 대안적 선형 구조는 효율성을 제공하지만, 대규모에서 다운스트림 과제에 대해 Transformer보다 성능이 떨어지는 경우가 많다.
  • Transformer에서 Mamba 구조로의 교차 구조 증류에 대한 이전 시도들은 성능 보존에 어려움을 겪었고, 흔히 하이브리드 Attention-SSM 해법을 필요로 했다.
  • 원칙에 입각한 2단계 증류 레시피가 개발되었다. 먼저 Softmax Attention에서 학습된 Linear Attention(Hedgehog)으로, 그다음 Linear Attention에서 적응된 Mamba(HedgeMamba)로 전이한다.
  • Mamba SSM 믹서 파라미터는 Linear Attention 단계에서 학습된 특징 맵을 사용해 초기화되었고, 추가적인 Mamba 구성요소는 항등 연산자로 작동하도록 설정되었다.
  • 이후 전체 HedgeMamba 구조는 정답에 대한 표준 교차 엔트로피 손실을 사용해 미세조정되어, 모든 Mamba 구성요소를 활성화했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)