Rethinking Expressivity and Efficiency in Test-Time Training

발행일
출처
arXiv
논문 번호
987
분야
Machine Learning
arXiv 번호
2608.21308

추론 중 가중치를 계속 갱신하는 TTT 기법에서 '토큰 단위 정밀함'과 '청크 단위 속도'를 동시에 잡은 수학적 폐형 해를 제안한 논문이다.

이 논문은 한마디로 긴 문맥 처리 기법 TTT(추론 중 학습)를 빠르면서도 정밀하게 만든 연구다. TTT는 추론하는 동안 내부 가중치를 계속 갱신해 긴 입력을 기억하는 기법인데, 토큰마다 갱신하면 정밀하지만 느리고 덩어리(청크)로 갱신하면 빠르지만 디테일이 죽는 딜레마가 있었다. 저자들은 청크 끝 상태를 정확히 재현하는 닫힌 형태 수식을 유도해 토큰 단위 정밀함을 청크 병렬 처리로 살렸다. 1.3B 모델을 처음부터 학습해 학습 맥락의 8배 길이에서도 90% 넘는 검색 정확도를 유지했고, 영상 이해에서는 TTT 파라미터만 학습해도 전체 미세조정과 동등한 성적을 냈다.

핵심 요약

  • 토큰별 학습률과 모멘텀, 감쇠를 살리면서 청크 병렬 학습이 가능한 닫힌 형태의 상태 전이식을 유도했다.
  • 학습 때보다 여덟 배 긴 입력의 바늘 찾기 시험에서도 90%가 넘는 정확도를 유지해 긴 문맥 외삽 성능을 보였다.
  • LongBench 14개 과제 평균에서 Mamba2와 LaCT 같은 이차 미만 계산량 구조보다 높은 성능을 기록했다.
  • Qwen3VL-2B에 병렬 분기로 붙였을 때 TTT 부분만 학습해도 전체 미세조정과 비슷한 영상 이해 성능을 냈다.
  • 청크 안에서는 하나의 빠른 가중치를 공유해 세밀한 인과 관계를 놓치는 구간이 남고, 실험 규모도 최대 13억 매개변수라 더 큰 모델 검증이 필요하다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)