Full-bandwidth transformer

발행일
출처
arXiv
논문 번호
878
분야
AI / General
arXiv 번호
2608.08888

이 논문은 트랜스포머의 마지막 층 숨은 상태를 다음 입력으로 다시 주입해서, 글자를 길게 늘어놓지 않아도 더 깊은 계산을 수행하게 만드는 '전체 대역폭 트랜스포머'를 제안한다.

이 논문은 한마디로 트랜스포머가 토큰(단어) 하나만 돌려주는 좁은 통로를, 전체 숨은 상태를 주고받는 넓은 통로로 바꿔서 추론 효율을 높인 연구다. 기존 트랜스포머는 이전 단계의 결과를 '단어 하나'로만 전달했는데, 이 연구는 이전 최상위 층의 전체 벡터를 게이트(gate, 정보를 선택적으로 통과시키는 장치)를 통해 다시 입력으로 주입한다. 1B(10억) 파라미터 모델을 400B(4천억) 토큰으로 학습해 실험한 결과, 거의 추가 비용 없이 토큰당 성능이 올라갔으며, 동일한 성능을 위해 훈련 데이터를 1.5~2배 줄일 수 있었다.

핵심 요약

  • 이전 토큰의 최상위 숨은 상태 전체를 다음 입력으로 주입하는 '잠재 피드백 디코딩'을 도입했다.
  • 표준 트랜스포머 구조와 KV 캐시를 그대로 유지하면서 추가 추론 비용은 1% 미만이다.
  • 1B 파라미터, 400B 토큰 학습에서 검증 손실, 수학/코딩 생성, 명령어 수행 등에서 일관된 향상을 보였다.
  • 동일한 성능을 위해 훈련 토큰을 약 1.5배 절약할 수 있으며, 일부 작업에서는 5배 토큰 학습 모델에 근접했다.
  • 잠재 피드백을 켜면 추론 흔적(생각 과정)이 더 짧아지면서도 정확도는 유지되거나 향상됐다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)