Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

발행일
출처
arXiv
논문 번호
210
분야
AI / General
arXiv 번호
2605.22791

NVIDIA 연구진이 개발한 Gated DeltaNet-2는 메모리 삭제 연산과 쓰기 연산을 별도의 채널별 게이트를 통해 분리함으로써 선형 순환 어텐션 모델을 향상시킨다.

선형 어텐션은 고정 크기 상태로 긴 문맥을 처리하지만 압축된 기억을 수정할 때 기존 정보가 뒤섞일 수 있다. 기존 델타 규칙 계열은 오래된 내용을 지우는 양과 새 값을 쓰는 양을 하나의 스칼라 게이트로 함께 조절했다. Gated DeltaNet-2는 채널별 지우기 게이트와 쓰기 게이트를 분리하고, 병렬 학습을 위한 청크 단위 알고리즘과 역전파 방법을 함께 제시한다. 1.3B 모델을 FineWeb-Edu 1000억 토큰으로 학습한 비교에서 Mamba-2, Gated DeltaNet, KDA, Mamba-3 변형보다 전반적으로 강한 결과를 냈다. 특히 긴 문맥의 다중 키 검색에서 장점이 컸으며, 보고된 비교 범위는 이 모델 규모와 기준 구조 및 벤치마크에 해당한다.

핵심 요약

  • 다중 키 검색: 유사한 연관 관계가 여러 개 존재하는 상황에서 Gated DeltaNet-2는 상당한 우위를 보였다. 이는 분리된 게이트가 고정 크기 상태 내에서 경쟁하는 정보 조각들을 모델이 더 잘 구분하도록 해준다는 점을 확인시켜 준다.
  • 간섭 제어: 특정 채널을 선택적으로 삭제함으로써, 모델은 새로운 정보가 여전히 관련성이 있을 수 있는 기존 저장 데이터를 덮어쓰거나 흐리게 만드는 것을 방지한다.
  • SWA는 작은 고정 윈도우, 예를 들어 최근 2,000개 토큰 내에서 국소적이고 고세분성의 상호작용을 처리한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)