Parallax: Parameterized Local Linear Attention for Language Modeling
- 발행일
- 출처
- arXiv
- 논문 번호
- 267
- 분야
- Machine Learning
- arXiv 번호
- 2605.29157
Parallax는 대규모 언어 모델 사전학습을 위해 Local Linear Attention(LLA)의 이론적 이점을 확장하는 Parameterized Local Linear Attention 메커니즘을 제안한다.
Parallax는 소프트맥스 주의의 국소 상수 추정을 국소 선형 추정으로 확장한 대규모 언어 모델용 주의 메커니즘이다. 기존 Local Linear Attention의 수치 해법을 없애고 키-값 공분산을 살피는 추가 질의형 투영기를 학습해 계산 안정성과 확장성을 높인다. 하드웨어 친화적 스트리밍 알고리즘과 시제품 디코드 커널은 여러 배치 크기와 문맥 길이에서 FlashAttention 2·3과 비슷하거나 더 빠른 성능을 보였다. 6억과 17억 매개변수 사전학습에서 퍼플렉서티와 후속 과제 정확도가 꾸준히 좋아졌고, 매개변수와 계산량을 맞춘 비교에서도 이점이 유지됐다. 다만 보고된 개선은 Muon 최적화기와 강하게 결합돼 있었고 평가 규모와 시제품 커널의 하드웨어 범위가 제한적이어서 더 큰 모델과 다양한 장치에서의 재현이 필요하다.
핵심 요약
- Perplexity: Parallax는 LAMBADA, WikiText 같은 데이터셋에서 Transformer 베이스라인 대비 일관되게 더 낮은 perplexity, 즉 모델이 표본을 얼마나 잘 예측하는지를 나타내는 척도를 달성했다.
- 다운스트림 과제: 질의응답과 상식 추론을 다루는 제로샷 벤치마크인 HellaSwag, ARC 등에서 Parallax는 뚜렷한 성능 향상을 보였다.
- 대조 실험: 성능 향상이 단순히 더 많은 파라미터나 더 많은 연산량 때문이 아님을 확인하기 위해, 저자들은 표준 Transformer의 파라미터 일치 버전과 연산량 일치 버전을 만들었다. Parallax는 두 버전 모두를 능가했으며, 이는 개선이 파라미터화된 국소 선형 메커니즘 자체에 내재된 것임을 시사한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.