Why do LLMs attend to the first token?
- 발행일
- 출처
- arXiv
- 논문 번호
- 050
- 분야
- Interpretability
- arXiv 번호
- 2504.02732
대규모 언어 모델은 주로 첫 번째 토큰을 향하는 어텐션 싱크를 학습한다. 이는 과도한 혼합과 표현 붕괴로 알려진 정보 열화를 막는 근본적 메커니즘이며, 특히 긴 문맥을 처리할 때 성능을 유지하는 데 핵심적이다.
대규모 언어 모델은 주로 첫 번째 토큰을 향하는 어텐션 싱크를 학습한다. 이는 과도한 혼합과 표현 붕괴로 알려진 정보 열화를 막는 근본적 메커니즘이며, 특히 긴 문맥을 처리할 때 성능을 유지하는 데 핵심적이다. 추론 시점에 이러한 싱크를 제거하면 다양한 과제 전반에서 모델의 유용성이 심각하게 손상된다.
핵심 요약
- 대규모 언어 모델이 첫 번째 토큰에 불균형하게 주의를 기울이는 '어텐션 싱크'라는 지속적이고 설명되지 않은 현상에는 기능적 설명이 부족했다.
- 랭크 붕괴, 표현 붕괴, 과도한 압착을 포함한 깊은 Transformer의 정보 열화 문제는 특히 긴 시퀀스에서 개별 토큰 정보의 손실을 초래한다.
- 어텐션 싱크가 왜 발생하며 어떤 기능적 목적을 수행하는지에 대한 근본적 이해가 기존 문헌에는 빠져 있었다.
- 이 논문은 어텐션 싱크를 과도한 혼합 및 표현 붕괴와 이론적으로 연결하고, 싱크가 정보 흐름을 어떻게 조절하는지 정량화하는 새로운 과도한 압착 한계를 도출한다.
- 최첨단 LLM인 Gemma 7B와 LLaMa 3.1 계열에 대한 광범위한 실증 검증을 섭동 분석, 어텐션 패턴 정밀 조사, 표적 절제 연구를 통해 수행했다.
- 통제된 사전 학습 실험을 통해 문맥 길이, 모델 규모, 그리고 어텐션 싱크의 형성 및 강도 사이의 인과 관계를 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.