Pretraining Recurrent Networks without Recurrence

발행일
출처
arXiv
논문 번호
332
분야
Machine Learning
arXiv 번호
2606.06479

순환 전파 없이 RNN을 사전학습하는 SMT 방법으로, 병렬 학습과 장거리 의존성 캡처를 동시에 달성한다.

Supervised Memory Training(SMT)은 RNN 학습을 단계 기억 전이 라벨 (m_t, x_{t+1}) → m_{t+1}에 대한 지도학습으로 환원해 순환적 credit propagation을 완전히 우회한다. Transformer 기반 인코더로 예측 상태 목표를 학습해 기억 라벨을 획득하며, 무엇을 기억할지와 어떻게 갱신할지를 분리한다. 그 결과 모든 토큰 쌍 사이 O(1) 길이 기울기 경로를 가지면서 시간 축 병렬 학습이 가능하다. 언어모델링과 픽셀 시퀀스 모델링에서 BPTT를 능가한다.

핵심 요약

  • RNN 학습을 단계 기억 전이에 대한 지도학습으로 환원해 순환 전파를 우회한다.
  • Transformer 기반 인코더로 기억 라벨을 생성해 무엇을 기억할지를 학습한다.
  • 모든 토큰 쌍 간 O(1) 기울기 경로로 장거리 의존성을 안정적으로 포착한다.
  • 시간 축 병렬 학습이 가능해 RNN 스케일링의 병목을 해소할 잠재력이 있다.
  • 언어모델링과 픽셀 시퀀스 모델링에서 표준 BPTT를 능가한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)