Fast Weight Attention for Continual Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1050
- 분야
- Machine Learning
- arXiv 번호
- 2608.27763
어텐션 대신 '고정 크기 상태'로 문맥을 압축하는 모델들의 상태 갱신 규칙을 온라인 학습 관점에서 이론적으로 정리하고, 새 갱신 규칙(Falcon 계열)을 유도한 논문.
이 논문은 한마디로 순환형 고속가중치 메모리와 상태공간모델(Mamba 계열)이 문맥을 고정 크기 상태로 압축할 때, 그 갱신 규칙이 사실상 '온라인 학습 규칙'임을 밝히고 정렬된 학습 쌍과 정규화된 1차 갱신식(Falcon-1/2/3과 내적 변형)을 유도한 이론 작업이다. 저자들은 다음 토큰 예측 목표에서 상태가 실제로 학습해야 하는 쌍은 한 스텝 어긋난 (직전 키, 현재 값)임을 보였다. 이 갱신식들은 청크 병렬 학습과도 호환된다. 언어모델링에서 경쟁력을 유지했고, 자릿수 덧셈 외삽(33~48자리)에서는 Falcon-3A.3가 87.2%로 모든 기준선을 넘었다.
핵심 요약
- 상태 갱신 규칙을 온라인 학습으로 재해석해, 시간 정렬·가소성·망각·리허설을 분리해 분석하는 틀을 만들었다.
- 다음 토큰 예측에서 상태가 학습해야 할 쌍이 (직전 키, 현재 값)으로 한 스텝 어긋나 있음을 밝혔다.
- 회귀 목표(Falcon-1/2/3)와 내적 목표(Falcon-1A/2A/3A)의 정규화 1차 갱신식을 유도하고 재발·마스크 병렬·청크 병렬 형태를 제공했다.
- 언어모델링 평가에서 기존 순환 모델들과 경쟁력을 유지했다.
- 33~48자리 덧셈 외삽에서 Falcon-3A.3가 87.2%로 RetNet·Transformer 기준선을 모두 앞섰다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.