Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity
- 발행일
- 출처
- arXiv
- 논문 번호
- 587
- 분야
- Machine Learning
- arXiv 번호
- 2607.07386
Gated DeltaNet의 dense 상태 업데이트를 희소화하여 상태 크기를 수천 배 확장한 선형 RNN 아키텍처. 동일 FLOPs에서 풀 어텐션보다 낮은 학습 손실 달성.
Sparse Delta Memory(SDM)는 Gated DeltaNet(GDN)의 dense key-value 외적을 product-key memory 기반의 희소 읽기/쓰기로 대체하여, 상태 메모리를 수천 배 확장하면서도 토큰당 연산량은 일정하게 유지하는 선형 RNN 아키텍처이다. 8B 규모, 1조 토큰 이상 학습에서 GDN은 물론 full softmax attention보다 낮은 학습 손실을 기록했으며, RULER 장문 맥락 회상 벤치마크에서도 압도적 우위를 보였다. 추가로 학습 가능한 초기 상태(learned initial state)를 도입하면 대용량 메모리가 사전학습 지식을 저장하는 매개체로 작동하여 공통 지식·추론 태스크 성능이 추가 향상된다.
핵심 요약
- Product-key memory 희소 addressing으로 GDN 대비 ~4,000× 더 큰 상태 메모리 확장 (8B 기준)
- 동일 FLOPs, 동일 파라미터에서 GDN 및 full attention 대비 우수한 학습 손실 달성
- RULER 장문 회상: 128k에서 GDN 20.0% → SDM 31.2% (1.4B, +11.2%p 절대 향상)
- 학습 가능한 초기 상태(learned M₀)로 사전학습 지식 저장, 공통 지식·추론 태스크 성능 추가 향상
- 8B 규모에서 GDN 대비 추론 1.49× 느리지만 full attention 대비 6× 빠른 디코딩
- 읽기/쓰기 분포가 가용 용량에 적응적으로 변화: 쓰기는 집중, 읽기는 분산 패턴
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.