xHC: Expanded Hyper-Connections

발행일
출처
arXiv
논문 번호
648
분야
Machine Learning
arXiv 번호
2607.14530

트랜스포머 잔차 스트림을 N=16까지 확장해 더 적은 compute로 더 낮은 loss를 달성하는 아키텍처 혁신.

이 논문은 한마디로 트랜스포머의 잔차 스트림(정보 통로)을 기존 N=4 한계를 넘어 N=16까지 효율적으로 확장하는 방법이다. 시간적 특징 증강으로 더 풍부한 정보를 쓰고, 희소 업데이트(16개 중 4개만)로 비용을 억제한다. 18B MoE에서 평균 다운스트림 +4.0점, compute는 vanilla 대비 1.50배 효율적이다. xHC-Flash로 메모리 트래픽도 mHC(N=4) 수준으로 줄인다.

핵심 요약

  • Hyper-Connection을 N=4 너머 N=16까지 확장하는 첫 방법. 기존 mHC는 N>4에서 수익 체감이 심했다.
  • 시간적 특징 증강(인접 토큰 정보로 write-back 풍부화) + 희소 잔차 업데이트(k=4/N=16)로 비용-효율을 동시에 잡았다.
  • 18B MoE에서 mHC 대비 평균 +4.0점, vanilla 대비 +4.1% FLOPs만 추가로 큰 향상을 달성했다.
  • Scaling-law: 같은 loss에 도달하는 데 vanilla는 1.50×, mHC는 1.19×의 compute가 필요하다(xHC 기준).
  • xHC-Flash: N=16임에도 서브레이어 메모리 트래픽 40C로 mHC N=4(34C)와 비슷하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)