Training-Free Looped Transformers

발행일
출처
arXiv
논문 번호
230
분야
Machine Learning
arXiv 번호
2605.23872

텍사스 대학교 오스틴의 연구진은 고정된 트랜스포머 체크포인트에 순환 구조를 덧붙여 추론 시점에 대규모 언어 모델의 성능을 향상시키는 학습 불필요 방법을 제안했다.

이 논문은 이미 학습된 트랜스포머의 연속된 중간 레이어 블록을 추론할 때 반복 실행하는 학습 불필요 래퍼를 제안한다. 사전 정규화 잔차 블록을 상미분방정식의 오일러 단계로 보고, 한 번의 큰 갱신을 감쇠된 작은 단계들로 나눠 같은 끝점을 더 잘 근사한다. 단순히 블록을 반복하면 성능이 흔히 나빠졌기 때문에 반복 위치, 감쇠 방식, 혼합 전문가 모델의 레이어별 실행과 캐시 복원이 중요했다. 일곱 개 모델 계열에서 Qwen3-4B-Instruct의 MMLU-Pro를 2.64%포인트 높이는 등 지식 중심 선택형 과제에서 개선을 보고했다. 고정된 설정에서 평가 조합의 87%가 개선되거나 중립이었지만, 일부 3B 미만 증류 모델에서는 손실이 집중되어 모든 모델과 과제에 이득이 보장되지는 않는다.

핵심 요약

  • 일관된 성능 향상: 이 방법은 지식 집약적 벤치마크에서 일관된 개선을 제공했다. 예를 들어 Qwen3-4B-Instruct는 MMLU-Pro에서 2.64 퍼센트포인트가 상승했다.
  • 반복 횟수 K에 대한 안정성: 반복을 추가할수록 붕괴하는 단순 루핑과 달리, 감쇠 RK 방식은 K가 증가해도 안정적으로 유지되거나 계속 개선된다(그림 3 참조).
  • 연산 오버헤드: 추가 비용은 추가로 통과하는 레이어 수에 비례한다. 다만 작은 윈도(예: 4개 레이어)만 루핑하므로, 32레이어 모델에서 전체 디코드 루프를 돌릴 때의 총 실시간 오버헤드는 흔히 약 20% 수준에 그친다. 저자들은 또한 초기 프롬프트 처리 단계에서만 루핑하는 'bypass' 모드를 도입했는데, 이는 토큰 생성 중 오버헤드가 거의 0에 가깝다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)