T^2MLR: Transformer with Temporal Middle-Layer Recurrence

발행일
출처
arXiv
논문 번호
650
분야
LLMs / NLP
arXiv 번호
2607.15178

트랜스포머 중간층에 순환 연결을 추가해, 적은 추론 비용으로 수학·논리 추론 능력을 크게 끌어올린 논문이다.

이 논문은 한마디로 트랜스포머의 중간층(추상적 사고가 일어나는 층)에 이전 토큰의 계산을 현재 토큰으로 직접 전달하는 '순환 통로'를 추가해 추론 능력을 높인 연구다. 기존 트랜스포머는 매 토큰마다 압축된 정보만 다음으로 넘기기 때문에 중간 추론 과정이 유지되기 어려웠다. T2MLR는 중간층 표현만 캐싱해서 이어주는 방식으로, 전체 층을 반복하는 것보다 20%만 순환시켜도 더 좋은 성능을 낸다. 1.7B 모델에 적용했을 때 GSM8K 수학 정확도가 35.8%에서 39.9%로, MATH500이 12.8%에서 18.0%로 올랐다. 추론 시간은 고작 8% 정도만 늘어난다.

핵심 요약

  • 트랜스포머의 '생각하는 층'인 중간층만 순환 연결하면 전체 층을 반복하는 것보다 추론 성능이 더 좋아진다는 것을 보였다.
  • 전체 층의 20%만 순환시켜도 충분하며, 이는 추론 지연을 최소화하면서 추론 능력을 극대화하는 설계다.
  • 기존에 학습된 1.7B 모델에 순환 통로만 추가하고 미세조정해도 수학 추론 정확도가 크게 올라간다 (GSM8K +4.1pp, MATH500 +5.2pp).
  • 추론 시 오버헤드가 약 8%에 불과해, 실제 서비스 환경에서도 부담 없이 적용할 수 있다.
  • 학습 비용은 2~4배 정도 늘지만, 추론 효율성과 성능 향상을 고려하면 의미 있는 트레이드오프다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)