Training-Free Looped Transformers
- 발행일
- 출처
- arXiv
- 논문 번호
- 230
- 분야
- Machine Learning
- arXiv 번호
- 2605.23872
텍사스 대학교 오스틴의 연구진은 고정된 트랜스포머 체크포인트에 순환 구조를 덧붙여 추론 시점에 대규모 언어 모델의 성능을 향상시키는 학습 불필요 방법을 제안했다.
이 논문은 이미 학습된 트랜스포머의 연속된 중간 레이어 블록을 추론할 때 반복 실행하는 학습 불필요 래퍼를 제안한다. 사전 정규화 잔차 블록을 상미분방정식의 오일러 단계로 보고, 한 번의 큰 갱신을 감쇠된 작은 단계들로 나눠 같은 끝점을 더 잘 근사한다. 단순히 블록을 반복하면 성능이 흔히 나빠졌기 때문에 반복 위치, 감쇠 방식, 혼합 전문가 모델의 레이어별 실행과 캐시 복원이 중요했다. 일곱 개 모델 계열에서 Qwen3-4B-Instruct의 MMLU-Pro를 2.64%포인트 높이는 등 지식 중심 선택형 과제에서 개선을 보고했다. 고정된 설정에서 평가 조합의 87%가 개선되거나 중립이었지만, 일부 3B 미만 증류 모델에서는 손실이 집중되어 모든 모델과 과제에 이득이 보장되지는 않는다.
핵심 요약
- 일관된 성능 향상: 이 방법은 지식 집약적 벤치마크에서 일관된 개선을 제공했다. 예를 들어 Qwen3-4B-Instruct는 MMLU-Pro에서 2.64 퍼센트포인트가 상승했다.
- 반복 횟수 K에 대한 안정성: 반복을 추가할수록 붕괴하는 단순 루핑과 달리, 감쇠 RK 방식은 K가 증가해도 안정적으로 유지되거나 계속 개선된다(그림 3 참조).
- 연산 오버헤드: 추가 비용은 추가로 통과하는 레이어 수에 비례한다. 다만 작은 윈도(예: 4개 레이어)만 루핑하므로, 32레이어 모델에서 전체 디코드 루프를 돌릴 때의 총 실시간 오버헤드는 흔히 약 20% 수준에 그친다. 저자들은 또한 초기 프롬프트 처리 단계에서만 루핑하는 'bypass' 모드를 도입했는데, 이는 토큰 생성 중 오버헤드가 거의 0에 가깝다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.