Memory Attention

발행일
출처
arXiv
논문 번호
1111
분야
Machine Learning
arXiv 번호
2609.28399

어텐션의 값(value)을 만드는 방식을 아예 바꿔서, 토큰별 기억표(임베딩 테이블) 조회로 대체하고 학습 토큰 수를 최대 30% 아껴준 논문.

이 논문은 한마디로 트랜스포머 어텐션에서 값(value)을 만들 때 값 투영 행렬을 없애고, 대신 '토큰별 기억표 + 키'를 더해서 값을 만드는 Memory Attention을 제안했다. 토큰에 따라 정해진 정보는 기억표에서 꺼내 쓰고(조회라서 계산이 거의 없음), 문맥에 따라 달라지는 정보는 기존 키가 담당한다. 같은 학습 토큰 예산에서 언어모델 성능과 다운스트림 태스크 평균 정확도가 올라갔고, 기억표를 CPU로 빼면(프리페치로 겹쳐서 가져옴) 파라미터 총량은 2배 이상 키우면서도 GPU 메모리는 기준 모델보다 조금 줄어들었다.

핵심 요약

  • 값 투영(value projection)을 없애고 V = K + Norm(M)으로 바꿔서, 값 계산을 테이블 조회와 덧셈만으로 끝내게 했다.
  • 같은 손실(loss)에 도달하는 데 필요한 학습 토큰 수가 작은 모델은 29.6%, 큰 모델은 13.8% 줄었다(토큰 효율 1.42배/1.16배).
  • 기억표를 CPU 메모리에 저장하는 MA-Offload로 GPU 파라미터 저장량을 55.45% 줄이면서도, 프리페치 덕분에 추론 속도는 기준과 거의 같았다(프리필 90.69ms vs 90.97ms).
  • 파라미터 총량은 기준 대비 약 2.08배로 늘었지만, 조회 기반 메모리라 계산량 늘림 없이 모델 용량을 키우는 효과를 봤다.
  • 학습 컨텍스트 길이의 2배 길이 검색(retrieval) 태스크에서도 성능 향상을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)