Improving Test-Time Scaling with Adaptive Looped Transformers

발행일
출처
arXiv
논문 번호
1136
분야
LLMs / NLP
arXiv 번호
2609.35748

레이어를 여러 번 돌리는 루프 트랜스포머에서, 반복이 필요한 토큰에만 추가 계산을 쓰는 적응형 반복 결정기를 학습시켜 테스트타임 스케일링 효율을 높인 논문이다.

이 논문은 한마디로 루프 트랜스포머(층을 재사용해 여러 번 계산하는 모델)의 테스트타임 스케일링을 더 효율적으로 만들었다. 모든 토큰에 고정된 깊이로 반복하면 불필요한 계산이 생기는데, 저자들은 '한 번 더 반복하면 예측이 좋아지는지'를 온라인 라벨로 감독하는 반복 결정기를 백본과 함께 학습시킨다(TaH2). 그 결과 계산을 두 배로 늘릴 때마다 얻는 정확도 이득(기울기)이 비루프 기준 대비 53% 좋아졌고, 같은 계산량에서 최고 정확도도 약 3.4점 앞선다. 기존 루프 모델은 깊이를 늘려도 정체되지만 TaH2는 깊이 8까지 이득이 계속 커졌다.

핵심 요약

  • '이 토큰이 한 번 더 반복하면 좋아지는가'를 알려주는 예측 라벨로 반복 결정기를 백본과 공동 학습시켰다.
  • 테스트타임 정확도-계산 기울기(계산 2배당 정확도 이득)가 비루프 기준 대비 53% 좋아졌다(2.74 vs 1.79).
  • 같은 계산량에서 AIME 최고 정확도가 약 3.4점 높고, 깊이를 2에서 8로 늘릴 때 이득이 +2.8점에서 +3.9점으로 계속 커졌다.
  • 고정 깊이 루프가 모든 토큰에 반복을 쓰는 것과 달리, 도움 되는 토큰에만 추가 계산을 집중했다.
  • 1.7B 모델 후학습(post-training)만으로 효과를 냈다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)