Learning to Reason in 13 Parameters

발행일
출처
arXiv
논문 번호
114
분야
Fine-tuning / Efficiency
arXiv 번호
2602.04118

Meta FAIR 연구진은 단 13개의 파라미터만 학습시켜도 대규모 언어 모델이 복잡한 수학적 추론 능력을 습득하게 하는 파라미터 효율적 미세조정 방법 TinyLoRA를 개발했다.

Meta FAIR 연구진은 단 13개의 파라미터만 학습시켜도 대규모 언어 모델이 복잡한 수학적 추론 능력을 습득하게 하는 파라미터 효율적 미세조정 방법 TinyLoRA를 개발했다. 이 접근법은 강화학습과 결합했을 때 GSM8K에서 91% 정확도를 달성하여, 초저용량 모델 적응에서 상당한 진전을 입증했다.

핵심 요약

  • 대규모 언어 모델의 미세조정은 전통적으로 수십억 개의 파라미터를 업데이트해야 하므로 높은 연산 및 메모리 비용을 초래한다.
  • 기존 파라미터 효율적 미세조정(PEFT) 방법은 파라미터를 줄이긴 해도 여전히 수백만 또는 수만 개 수준에서 동작하여, 제약이 심한 환경에서의 적용을 제한한다.
  • 특히 복잡한 추론 과제에 대해 효과적인 적응에 필요한 근본적인 최소 파라미터 수를 이해할 필요가 있다.
  • 이 논문은 TinyLoRA를 도입했는데, 이는 학습 가능한 r×r 행렬을 고정된 무작위 텐서를 통해 투영되는 저차원 학습 가능 벡터로 대체하여 LoRA-XS를 확장한 새로운 PEFT 방법으로, 모듈당 파라미터를 크게 줄인다.
  • 공격적인 가중치 묶기 전략을 구현하여 학습 가능 벡터를 모델의 여러 또는 모든 레이어에서 공유하도록 함으로써, 총 학습 가능 파라미터를 한 자릿수까지 줄였다.
  • 강화학습(특히 GRPO)을 핵심 학습 알고리즘으로 활용하여, 제약이 심한 파라미터 업데이트를 위해 희소한 보상 기반 신호를 활용하는 독보적 효율성을 입증했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)