Tina: Tiny Reasoning Models via LoRA
- 발행일
- 출처
- arXiv
- 논문 번호
- 065
- 분야
- Reasoning / Small Models
- arXiv 번호
- 2504.15777
University of Southern California의 연구 프로젝트 Tina는 언어 모델에 강력한 추론 능력을 부여하는 매우 비용 효율적인 접근법을 제시한다.
University of Southern California의 연구 프로젝트 Tina는 언어 모델에 강력한 추론 능력을 부여하는 매우 비용 효율적인 접근법을 제시한다. 작은 1.5B 기반 모델과 LoRA 기반 강화학습을 결합하면 동일 기반 모델로 구축된 최첨단 RL 모델의 추론 성능에 필적하거나 이를 능가할 수 있으며, 단일 모델 기준 사후 학습 비용을 9 USD 수준까지 낮춰 이를 달성함을 보인다.
핵심 요약
- 대규모 언어 모델에서 견고한 다단계 추론을 달성하는 것은 여전히 중대한 과제로 남아 있다.
- 지도 미세조정이나 강화학습 같은 현재의 LLM 추론 향상 방법은 자원 집약적이며, 흔히 막대한 연산 능력과 대형 모델을 요구한다.
- RL 파이프라인의 높은 비용과 복잡성은 언어 모델을 위한 RL 기반 추론에 대한 접근성과 폭넓은 연구를 제약한다.
- 초기 추론 적성으로 알려진 작은 15억 파라미터 기반 모델 DeepSeek-R1-Distill-Qwen-1.5B를 활용한다.
- GRPO 방식 알고리즘을 사용한 파라미터 효율적 강화학습을 위해 Low-Rank Adaptation(LoRA)을 적용하여, 모델 파라미터의 일부만 업데이트한다.
- 비용 효율성과 기존 모델과의 직접 비교 가능성을 확보하기 위해, 두 개의 NVIDIA L40S GPU와 공개된 추론 데이터셋을 이용한 최소주의적 학습 설정을 활용한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.