Prefix Sliding for efficient test-time scaling

발행일
출처
arXiv
논문 번호
1028
분야
LLMs / NLP
arXiv 번호
2608.26070

LLM이 길게 생각할 때 프리픽스(지시문)와 최근 몇천 토큰만 남기고 중간 추론 토큰을 버려, 학습 없이 3배 빠르게 만드는 기법.

이 논문은 한마디로 추론 중간의 토큰 대부분은 곧 쓸모가 없어진다는 관찰에서 출발해 Prefix Sliding을 제안했다. 전체 추론 흔적을 메모리에 두는 풀 어텐션(전체 토큰을 다 보는 방식)은 길어질수록 토큰당 비용이 커지는데, 프리픽스와 최근 윈도우만 보면 비용이 일정해진다. 학습 없이 기존 모델에서 성능 유지와 3배 속도를 얻었고, RL 학습과 결합하면 10만 토큰이 넘는 초장문 추론 트레이스로 학습할 수 있다. 중간 토큰을 요약하거나 단순 슬라이딩 윈도우만 쓰는 방법보다 낫다는 것도 확인했다.

핵심 요약

  • 어텐션 분석으로 중간 추론 토큰은 빠르게 중요도를 잃고 프리픽스와 최근 토큰만 중요하다는 사실을 보였다.
  • 학습 없이 기존 모델(Qwen3)에 적용해 성능 유지와 3배 빠른 추론을 달성했다.
  • RL 학습과 결합해 10만 토큰을 넘는 추론으로 학습할 수 있게 해, 긴 롤아웃을 버리던 문제를 해결했다.
  • 중간 토큰 요약이나 단순 슬라이딩 윈도우 같은 대안보다 성능과 속도 모두 우위를 확인했다.
  • 코딩 벤치마크(LiveCodeBench)처럼 초반 코드를 오래 기억해야 하는 과제는 큰 윈도우(16384)가 필요하다는 한계도 밝혔다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)