Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

발행일
출처
arXiv
논문 번호
893
분야
LLMs / NLP
arXiv 번호
2608.12149

이 논문은 혼합 선형 어텐션 LLM에서 매우 큰 내부 활성값이 완전 어텐션 층의 위치에 맞춰 두 가지 반복 패턴을 만든다는 점을 분석했다.

이 논문은 한마디로 선형 어텐션과 완전 어텐션을 섞은 언어 모델에서 신경망 내부 계산값이 매우 커지는 위치를 추적했다. 완전 어텐션 직전에는 값이 크게 튀었고, 그 사이 선형 어텐션 층에서는 높은 값이 고원처럼 이어졌다. 완전 어텐션 층이 많아질수록 두 패턴은 이어져 일반 트랜스포머의 안정적인 큰 활성값 형태에 가까워졌다. 저자들은 큰 값이 반대 부호의 업데이트로 사라지는 시점 차이가 두 패턴을 만든다고 해석한다.

핵심 요약

  • 첫 번째 패턴은 완전 어텐션 층 바로 앞에서 값이 크게 튀는 현상이다. 두 번째 패턴은 그 값이 다음 스파이크 사이의 여러 선형 어텐션 층에서 높게 유지되는 현상이다.
  • 선형 어텐션 구조 5종, 혼합 비율 6종, 입력 분야 5종과 12억부터 3,970억 매개변수의 공개 모델에서 같은 패턴을 확인했다.
  • 통제된 3억 4,000만과 13억 매개변수 모델의 12대1 혼합 설정에서, 완전 어텐션 직전과 스파이크 위치의 일치율은 전체 평균 99.4%에서 100%였다.
  • 3억 4,000만 매개변수 통제 모델에서는 두 패턴이 첫 측정 시점인 학습 10억 토큰 뒤부터 보였다. 완전 어텐션 출력 게이트는 값의 크기를 줄였지만 층별 위치 패턴은 없애지 못했다.
  • 저자들은 빠른 상쇄가 스파이크를, 늦은 상쇄가 고원을 만든다고 설명하지만 상쇄 시점의 원인과 실제 계산 역할은 후속 과제로 남겼다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)