Learn from your own latents and not from tokens: A sample-complexity theory

발행일
출처
arXiv
논문 번호
269
분야
Machine Learning
arXiv 번호
2605.27734

이 연구는 모델 자신의 잠재 표현으로부터 학습하는 것이 계층적 구조에 대한 데이터 효율성을 크게 향상시킨다는 것을 보이는 표본 복잡도 이론을 제시한다.

이 논문은 토큰 자체가 아니라 모델이 만든 잠재표현을 예측하는 자기지도 학습이 왜 데이터 효율적일 수 있는지 표본 복잡도로 분석한다. 자연어와 이미지의 계층적 조합 구조를 나타내는 깊이 L의 확률적 문맥 자유 문법을 이론적 데이터 모형으로 사용한다. 이 설정에서 감독학습이나 토큰 수준 자기지도 학습은 숨은 트리를 복원하는 데 L에 대해 지수적으로 많은 표본이 필요하지만, 잠재 예측은 로그 요인을 제외하면 L과 무관한 수의 표본으로 가능함을 증명한다. 계층 군집 알고리즘, 잠재값을 층마다 예측하는 신경망, data2vec 분석의 세 방식으로 이 경계를 확인했으며 data2vec가 암묵적으로 계층적 잠재 예측을 수행한다고 해석한다. 다만 결론은 분석 가능한 확률 문법이라는 이론적 설정에 기반하므로 실제 대규모 자연 데이터에서 같은 크기의 이득이 그대로 나타나는지는 별도 검증이 필요하다.

핵심 요약

  • 예측기(Predictor): 잠재값의 튜플을 입력받아 그 사촌 잠재값의 분포를 예측하려는 네트워크다.
  • 군집기(Clusterer): 예측기의 출력을 이산적 코드 또는 군집 정체성으로 압축하는 네트워크다. 이 코드가 다음 계층의 입력이 된다.
  • 리프터로서의 교사: EMA 교사는 학습된 잠재값을 자신의 타깃에 점진적으로 통합한다. 이는 학습이 진행되는 동안 예측 과제를 토큰 수준에서 잠재 수준으로 끌어올린다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)