xHC: Expanded Hyper-Connections
- 발행일
- 출처
- arXiv
- 논문 번호
- 648
- 분야
- Machine Learning
- arXiv 번호
- 2607.14530
트랜스포머 잔차 스트림을 N=16까지 확장해 더 적은 compute로 더 낮은 loss를 달성하는 아키텍처 혁신.
이 논문은 한마디로 트랜스포머의 잔차 스트림(정보 통로)을 기존 N=4 한계를 넘어 N=16까지 효율적으로 확장하는 방법이다. 시간적 특징 증강으로 더 풍부한 정보를 쓰고, 희소 업데이트(16개 중 4개만)로 비용을 억제한다. 18B MoE에서 평균 다운스트림 +4.0점, compute는 vanilla 대비 1.50배 효율적이다. xHC-Flash로 메모리 트래픽도 mHC(N=4) 수준으로 줄인다.
핵심 요약
- Hyper-Connection을 N=4 너머 N=16까지 확장하는 첫 방법. 기존 mHC는 N>4에서 수익 체감이 심했다.
- 시간적 특징 증강(인접 토큰 정보로 write-back 풍부화) + 희소 잔차 업데이트(k=4/N=16)로 비용-효율을 동시에 잡았다.
- 18B MoE에서 mHC 대비 평균 +4.0점, vanilla 대비 +4.1% FLOPs만 추가로 큰 향상을 달성했다.
- Scaling-law: 같은 loss에 도달하는 데 vanilla는 1.50×, mHC는 1.19×의 compute가 필요하다(xHC 기준).
- xHC-Flash: N=16임에도 서브레이어 메모리 트래픽 40C로 mHC N=4(34C)와 비슷하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.