Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention
- 발행일
- 출처
- arXiv
- 논문 번호
- 210
- 분야
- AI / General
- arXiv 번호
- 2605.22791
NVIDIA 연구진이 개발한 Gated DeltaNet-2는 메모리 삭제 연산과 쓰기 연산을 별도의 채널별 게이트를 통해 분리함으로써 선형 순환 어텐션 모델을 향상시킨다.
선형 어텐션은 고정 크기 상태로 긴 문맥을 처리하지만 압축된 기억을 수정할 때 기존 정보가 뒤섞일 수 있다. 기존 델타 규칙 계열은 오래된 내용을 지우는 양과 새 값을 쓰는 양을 하나의 스칼라 게이트로 함께 조절했다. Gated DeltaNet-2는 채널별 지우기 게이트와 쓰기 게이트를 분리하고, 병렬 학습을 위한 청크 단위 알고리즘과 역전파 방법을 함께 제시한다. 1.3B 모델을 FineWeb-Edu 1000억 토큰으로 학습한 비교에서 Mamba-2, Gated DeltaNet, KDA, Mamba-3 변형보다 전반적으로 강한 결과를 냈다. 특히 긴 문맥의 다중 키 검색에서 장점이 컸으며, 보고된 비교 범위는 이 모델 규모와 기준 구조 및 벤치마크에 해당한다.
핵심 요약
- 다중 키 검색: 유사한 연관 관계가 여러 개 존재하는 상황에서 Gated DeltaNet-2는 상당한 우위를 보였다. 이는 분리된 게이트가 고정 크기 상태 내에서 경쟁하는 정보 조각들을 모델이 더 잘 구분하도록 해준다는 점을 확인시켜 준다.
- 간섭 제어: 특정 채널을 선택적으로 삭제함으로써, 모델은 새로운 정보가 여전히 관련성이 있을 수 있는 기존 저장 데이터를 덮어쓰거나 흐리게 만드는 것을 방지한다.
- SWA는 작은 고정 윈도우, 예를 들어 최근 2,000개 토큰 내에서 국소적이고 고세분성의 상호작용을 처리한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.