Sliding-window beats linear attention
- 발행일
- 출처
- arXiv
- 논문 번호
- 1046
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.28444
값비싼 '선형 어텐션' 개조 대신, 추가 학습 없는 슬라이딩 윈도우 어텐션(최근 토큰+맨 앞 몇 개만 보기)이 메모리도 아끼고 성능도 더 좋다는 걸 정면 비교로 보여준 논문.
이 논문은 한마디로 LLM의 메모리 문제 해결책으로 유행하는 '선형 어텐션 전환'보다, 아무 추가 학습 없이 쓸 수 있는 슬라이딩 윈도우 어텐션(SWA)이 낫거나 최소한 동등하다는 것을 보여준 것이다. 저자들은 1.3B~70B 크기의 여러 LLM과 다양한 벤치마크에서 두 방식을 정면 비교했다. 일반 과제에서 SWA는 원래 모델 성능의 99%를 회복했고, 긴 문맥 과제(바늘찾기, BABILong)에서는 선형 어텐션 대비 2~10배 높은 정확도를 냈다. 결론은 추론 메모리를 줄이고 싶으면 값비싼 개조 대신 SWA를 쓰라는 것이다.
핵심 요약
- 추가 학습 0회: 어텐션 마스크만 바꾸는 SWA로, 수십억~수십억 토큰 재학습이 필요한 선형 어텐션 전환과 맞먹거나 능가했다.
- 긴 문맥에서 격차가 더 컸다. 256K 컨텍스트에서 SWA는 원래 성능의 20~25%를 회복했지만 선형 어텐션(LoLCATs)은 2.2~5%에 그쳤다.
- MMLU에서 SWA는 원 성능의 93.2%를 회복해 LoLCATs(83.2%), Liger-GLA(62.2%) 등 주요 선형화 방법을 모두 앞질렀다.
- SWA(윈도우 64)는 테스트한 방식 중 디코딩 속도가 가장 빠르고 메모리도 가장 적게 들었다.
- 영상 생성 모델에서도 훈련 없는 슬라이딩 윈도우가 강력한 기준선이라는 점을 관련 연구 인용으로 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.