Pretraining Recurrent Networks without Recurrence
- 발행일
- 출처
- arXiv
- 논문 번호
- 332
- 분야
- Machine Learning
- arXiv 번호
- 2606.06479
순환 전파 없이 RNN을 사전학습하는 SMT 방법으로, 병렬 학습과 장거리 의존성 캡처를 동시에 달성한다.
Supervised Memory Training(SMT)은 RNN 학습을 단계 기억 전이 라벨 (m_t, x_{t+1}) → m_{t+1}에 대한 지도학습으로 환원해 순환적 credit propagation을 완전히 우회한다. Transformer 기반 인코더로 예측 상태 목표를 학습해 기억 라벨을 획득하며, 무엇을 기억할지와 어떻게 갱신할지를 분리한다. 그 결과 모든 토큰 쌍 사이 O(1) 길이 기울기 경로를 가지면서 시간 축 병렬 학습이 가능하다. 언어모델링과 픽셀 시퀀스 모델링에서 BPTT를 능가한다.
핵심 요약
- RNN 학습을 단계 기억 전이에 대한 지도학습으로 환원해 순환 전파를 우회한다.
- Transformer 기반 인코더로 기억 라벨을 생성해 무엇을 기억할지를 학습한다.
- 모든 토큰 쌍 간 O(1) 기울기 경로로 장거리 의존성을 안정적으로 포착한다.
- 시간 축 병렬 학습이 가능해 RNN 스케일링의 병목을 해소할 잠재력이 있다.
- 언어모델링과 픽셀 시퀀스 모델링에서 표준 BPTT를 능가한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.