Sliding-window beats linear attention

발행일
출처
arXiv
논문 번호
1046
분야
LLMs / NLP
arXiv 번호
2608.28444

값비싼 '선형 어텐션' 개조 대신, 추가 학습 없는 슬라이딩 윈도우 어텐션(최근 토큰+맨 앞 몇 개만 보기)이 메모리도 아끼고 성능도 더 좋다는 걸 정면 비교로 보여준 논문.

이 논문은 한마디로 LLM의 메모리 문제 해결책으로 유행하는 '선형 어텐션 전환'보다, 아무 추가 학습 없이 쓸 수 있는 슬라이딩 윈도우 어텐션(SWA)이 낫거나 최소한 동등하다는 것을 보여준 것이다. 저자들은 1.3B~70B 크기의 여러 LLM과 다양한 벤치마크에서 두 방식을 정면 비교했다. 일반 과제에서 SWA는 원래 모델 성능의 99%를 회복했고, 긴 문맥 과제(바늘찾기, BABILong)에서는 선형 어텐션 대비 2~10배 높은 정확도를 냈다. 결론은 추론 메모리를 줄이고 싶으면 값비싼 개조 대신 SWA를 쓰라는 것이다.

핵심 요약

  • 추가 학습 0회: 어텐션 마스크만 바꾸는 SWA로, 수십억~수십억 토큰 재학습이 필요한 선형 어텐션 전환과 맞먹거나 능가했다.
  • 긴 문맥에서 격차가 더 컸다. 256K 컨텍스트에서 SWA는 원래 성능의 20~25%를 회복했지만 선형 어텐션(LoLCATs)은 2.2~5%에 그쳤다.
  • MMLU에서 SWA는 원 성능의 93.2%를 회복해 LoLCATs(83.2%), Liger-GLA(62.2%) 등 주요 선형화 방법을 모두 앞질렀다.
  • SWA(윈도우 64)는 테스트한 방식 중 디코딩 속도가 가장 빠르고 메모리도 가장 적게 들었다.
  • 영상 생성 모델에서도 훈련 없는 슬라이딩 윈도우가 강력한 기준선이라는 점을 관련 연구 인용으로 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)