Proteus: Incremental Memory Activation for Long-Context Sequence Modeling
- 발행일
- 출처
- arXiv
- 논문 번호
- 922
- 분야
- Machine Learning
- arXiv 번호
- 2608.16844
긴 글을 처음부터 큰 기억 공간에 넣지 않고, 초반에는 좁게 압축한 뒤 뒤로 갈수록 새 공간을 여는 메모리 관리법이다.
이 논문은 한마디로 긴 문맥 모델의 메모리를 처음부터 모두 쓰지 않고 점차 활성화하는 Proteus를 제안한다. 고정 크기 메모리를 처음부터 열어 두면 앞부분 정보가 지나치게 많은 공간을 차지하고 뒷부분이 덮어쓰기를 일으킬 수 있다는 문제에서 출발한다. 전체 크기는 그대로 두고 여러 블록으로 나눈 뒤, 초반에는 일부만 읽고 쓰게 하며 문맥이 길어질수록 나머지를 차례로 연다. SWLA, Comba, Titans와 Hope-Attention 네 구조에 적용해 매개변수나 총 메모리 증가 없이 긴 문맥 성능을 높였다. 다만 활성화 순서는 위치에 따라 균등하게 여는 고정 규칙이고 짧거나 이미 포화된 과제에서는 효과가 거의 없었다.
핵심 요약
- 기본 실험은 메모리를 16개 블록으로 나눴다. 읽기와 쓰기를 모두 현재 활성화된 블록에만 허용하고 잠긴 블록은 열릴 때까지 보존한다.
- 13억 매개변수와 학습 토큰 1천억 개 조건에서 Titans의 WikiText 혼란도는 15.36에서 14.94로, LAMBADA 혼란도는 13.18에서 13.03으로 낮아졌다.
- FineWeb에서 8K 문맥으로 학습한 뒤 16K로 평가한 S-NIAH-3에서 Titans 정확도는 21.4에서 29.8로, S-NIAH-2는 69.4에서 74.2로 높아졌다.
- LongBench 6개 과제 평균은 Hope-Attention이 15.72에서 16.65로, Comba가 13.05에서 13.23으로, Titans가 13.80에서 14.15로 올랐다.
- 최적 활성화 순서는 따로 찾지 않았다. MLP 블록으로의 확장도 Hope-Attention 한 구조에서만 확인한 개념 검증 수준이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.