Learning to Reason in 13 Parameters
- 발행일
- 출처
- arXiv
- 논문 번호
- 114
- 분야
- Fine-tuning / Efficiency
- arXiv 번호
- 2602.04118
Meta FAIR 연구진은 단 13개의 파라미터만 학습시켜도 대규모 언어 모델이 복잡한 수학적 추론 능력을 습득하게 하는 파라미터 효율적 미세조정 방법 TinyLoRA를 개발했다.
Meta FAIR 연구진은 단 13개의 파라미터만 학습시켜도 대규모 언어 모델이 복잡한 수학적 추론 능력을 습득하게 하는 파라미터 효율적 미세조정 방법 TinyLoRA를 개발했다. 이 접근법은 강화학습과 결합했을 때 GSM8K에서 91% 정확도를 달성하여, 초저용량 모델 적응에서 상당한 진전을 입증했다.
핵심 요약
- 대규모 언어 모델의 미세조정은 전통적으로 수십억 개의 파라미터를 업데이트해야 하므로 높은 연산 및 메모리 비용을 초래한다.
- 기존 파라미터 효율적 미세조정(PEFT) 방법은 파라미터를 줄이긴 해도 여전히 수백만 또는 수만 개 수준에서 동작하여, 제약이 심한 환경에서의 적용을 제한한다.
- 특히 복잡한 추론 과제에 대해 효과적인 적응에 필요한 근본적인 최소 파라미터 수를 이해할 필요가 있다.
- 이 논문은 TinyLoRA를 도입했는데, 이는 학습 가능한 r×r 행렬을 고정된 무작위 텐서를 통해 투영되는 저차원 학습 가능 벡터로 대체하여 LoRA-XS를 확장한 새로운 PEFT 방법으로, 모듈당 파라미터를 크게 줄인다.
- 공격적인 가중치 묶기 전략을 구현하여 학습 가능 벡터를 모델의 여러 또는 모든 레이어에서 공유하도록 함으로써, 총 학습 가능 파라미터를 한 자릿수까지 줄였다.
- 강화학습(특히 GRPO)을 핵심 학습 알고리즘으로 활용하여, 제약이 심한 파라미터 업데이트를 위해 희소한 보상 기반 신호를 활용하는 독보적 효율성을 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.