Transformer²: Self-adaptive LLMs

발행일
출처
arXiv
논문 번호
016
분야
Architecture / Adaptation
arXiv 번호
2501.06252

과제 적응형 LLM에 이르는 실용적 경로다. SVD 특이값 스케일링을 조합 가능한 전문가 벡터로 전환한 뒤, 모델을 재학습하는 대신 추론 시점에 이를 디스패치하고 혼합한다.

Transformer²는 첫 번째 패스에서 과제 속성을 파악하고 두 번째 패스에서 과제별 전문가 벡터를 모델 가중치에 적용하는 2패스 자기 적응 프레임워크를 제안한다. 핵심 메커니즘인 Singular Value Fine-tuning(SVF)은 가중치 행렬을 분해하여 특이값에 대한 스케일링 벡터만 학습하므로, LoRA보다 훨씬 적은 파라미터로 풀랭크 영향을 준다. 전문가는 강화학습으로 학습되며 프롬프트 분류, 학습된 분류 전문가, 또는 퓨샷 CEM 기반 보간으로 선택될 수 있다. Llama, Mistral, 비전-언어 설정 전반의 실험에서 LoRA 대비 일관된 향상을 보고하며, GSM8K, MBPP-Pro, ARC-Easy, TextVQA에서 두드러진 개선과 함께 SVF 전문가의 모델 간 전이도 보여준다. 주된 트레이드오프는 추가되는 2패스 추론 오버헤드와 사전 학습된 전문가 라이브러리에 대한 의존이지만, 조합성과 전이 결과는 모듈식 적응형 LLM을 향한 강력한 진전이 되게 한다.

핵심 요약

  • 방법: SVF는 가산형 어댑터를 각 가중치 행렬의 특이값에 대한 학습된 스케일링으로 대체하여, 기저 특이 벡터는 보존하면서 과제 행동을 변경한다.
  • 적응: Transformer²는 디스패치-앤-어플라이 추론을 사용하며, 전문가는 직접 선택하거나, 학습된 분류기 전문가로, 또는 퓨샷 CEM 최적화를 통해 혼합할 수 있다.
  • 결과: 이 논문은 SVF와 Transformer²가 LoRA 파라미터 수의 10% 미만으로 LoRA를 능가한다고 보고하며, 여기에는 수학·코드·추론·비전-언어 벤치마크에서의 향상이 포함된다.
  • 의미: 가장 강력한 증거는 단지 더 높은 점수가 아니라 전문가 조합성과 모델 간 전이로, 일회성 파인튜닝이 아닌 재사용 가능한 스킬 벡터를 시사한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)