Decoding Looped Transformers Better for (Almost) Free

발행일
출처
arXiv
논문 번호
1149
분야
Machine Learning
arXiv 번호
2610.02185

이 논문은 반복(loop) 구조 트랜스포머에서 초회 예측과 최종 예측의 차이를 활용해 추가 학습 없이 답 품질을 높였다.

이 논문은 한마디로 같은 모델 안의 '어린 예측'과 '성숙한 예측'을 비교해 토큰 선택을 바로잡는 디코딩 기법이다. 반복 트랜스포머(같은 층 블록을 여러 번 돌려 생각을 깊게 하는 구조)는 중간 단계마다 예측을 만들지만 기존 디코딩은 이를 버렸다. LoopCD는 첫 회차 예측을 약한 참조로 삼아 최종 예측에서 빼는 방향으로 보정한다. 학습·보조 모델 없이 AIME 2024 정답률을 61.88%에서 73.33%로 올렸고, 반복 횟수를 절반으로 줄여도 원래 성능을 유지해 연산량을 22.5~48.2% 줄였다.

핵심 요약

  • 반복 트랜스포머의 초회 예측을 '약한 모델'로 활용하는 무학습 대비 디코딩(contrastive decoding)을 제안했다.
  • LoopCD-Logits는 Ouro-2.6B의 AIME 2024 pass@1을 61.88%에서 73.33%로, LoopCD-Hidden은 Huginn의 HumanEval을 22.56%에서 31.71%로 높였다.
  • 반복 횟수를 절반으로 줄여도 전체 깊이 기준 모델과 같거나 나은 성능을 유지해 연산량을 22.5~48.2% 줄였다.
  • 숫자 맞히기 같은 객관형에는 강한 보정(ω=0.5)이, 길게 생성하는 과제에는 약한 보정(ω=0.2~0.3)이 필요함을 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)