Modular TTT: Rethinking Test-Time Training as Composable Modules
- 발행일
- 출처
- arXiv
- 논문 번호
- 854
- 분야
- Machine Learning
- arXiv 번호
- 2608.07110
Test-Time Training(추론 시 학습)을 레고 블록처럼 조립 가능한 모듈로 쪼개어, 어떤 설계가 좋은지 체계적으로 분석한 프레임워크다.
이 논문은 한마디로 시퀀스 처리 모델의 새로운 방식인 TTT(추론 시 학습)를 모듈화해서, 어떤 설계가 성능에 도움이 되고 어떤 게 방해가 되는지 체계적으로 분석했다. TTT는 모델이 데이터를 처리하면서 내부 파라미터를 업데이트하는 방식인데, 기존에는 각 버전을 따로따로 하드코딩해서 비교가 어려웠다. Modular TTT는 내부 학습기를 DAG(방향성 그래프)로 표현하고, 손실 함수·학습률·가중치 감쇠 등을 독립적으로 바꿀 수 있게 했다. 분석 결과: 작은 학습률 초기화, 가중치 감쇠, 단층 비선형성이 도움이 되고, 깊은 네트워크나 정규화는 오히려 해롭다. 최적 조합으로 410M/1.45B 모델을 학습해 Gated DeltaNet과 동급 성능을 달성했다.
핵심 요약
- TTT 내부 학습기를 DAG로 표현해 손실 함수, 학습률, 가중치 감쇠, 정규화 등을 독립적으로 조절 가능한 모듈형 프레임워크를 만들었다.
- 작은 학습률 초기화, 가중치 감쇠, 단층 비선형성(SiLU)이 일관된 성능 향상을 가져왔다.
- 반면 깊은 fast-weight 네트워크와 정규화는 활성화 값이 너무 커져서 오히려 성능을 해쳤다. 잔차 연결이나 게이팅은 효과가 미미했다.
- 최적 변형으로 410M, 1.45B 모델을 100B 토큰으로 학습해 Gated DeltaNet과 동급의 성능을 달성했다.
- ByteDance에서 개발했으며 최적화 구현체를 공개해 기존 TTT 대비 학습 처리량을 여러 배 향상시켰다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.