Fast Weight Attention for Continual Learning

발행일
출처
arXiv
논문 번호
1050
분야
Machine Learning
arXiv 번호
2608.27763

어텐션 대신 '고정 크기 상태'로 문맥을 압축하는 모델들의 상태 갱신 규칙을 온라인 학습 관점에서 이론적으로 정리하고, 새 갱신 규칙(Falcon 계열)을 유도한 논문.

이 논문은 한마디로 순환형 고속가중치 메모리와 상태공간모델(Mamba 계열)이 문맥을 고정 크기 상태로 압축할 때, 그 갱신 규칙이 사실상 '온라인 학습 규칙'임을 밝히고 정렬된 학습 쌍과 정규화된 1차 갱신식(Falcon-1/2/3과 내적 변형)을 유도한 이론 작업이다. 저자들은 다음 토큰 예측 목표에서 상태가 실제로 학습해야 하는 쌍은 한 스텝 어긋난 (직전 키, 현재 값)임을 보였다. 이 갱신식들은 청크 병렬 학습과도 호환된다. 언어모델링에서 경쟁력을 유지했고, 자릿수 덧셈 외삽(33~48자리)에서는 Falcon-3A.3가 87.2%로 모든 기준선을 넘었다.

핵심 요약

  • 상태 갱신 규칙을 온라인 학습으로 재해석해, 시간 정렬·가소성·망각·리허설을 분리해 분석하는 틀을 만들었다.
  • 다음 토큰 예측에서 상태가 학습해야 할 쌍이 (직전 키, 현재 값)으로 한 스텝 어긋나 있음을 밝혔다.
  • 회귀 목표(Falcon-1/2/3)와 내적 목표(Falcon-1A/2A/3A)의 정규화 1차 갱신식을 유도하고 재발·마스크 병렬·청크 병렬 형태를 제공했다.
  • 언어모델링 평가에서 기존 순환 모델들과 경쟁력을 유지했다.
  • 33~48자리 덧셈 외삽에서 Falcon-3A.3가 87.2%로 RetNet·Transformer 기준선을 모두 앞섰다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)