LIMO: Less is More for Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 027
- 분야
- Reasoning / Data Efficiency
- arXiv 번호
- 2502.03387
상하이교통대학교와 SII-GAIR의 LIMO(Less is More for Reasoning) 연구는 대규모 언어 모델을 위한 지도 미세조정 방법을 개발해, 신중하게 큐레이션된 800개 예시의 최소 데이터셋만으로 고급 수학적 추론을 달성할 수 있음을 입증했다.
상하이교통대학교와 SII-GAIR의 LIMO(Less is More for Reasoning) 연구는 대규모 언어 모델을 위한 지도 미세조정 방법을 개발해, 신중하게 큐레이션된 800개 예시의 최소 데이터셋만으로 고급 수학적 추론을 달성할 수 있음을 입증했다. 이 접근법은 여러 벤치마크에 걸쳐 평균 78.1%의 성능을 달성해, 훨씬 더 큰 데이터셋으로 미세조정된 OpenAI-o1-preview(61.1%)와 QwQ-32B-Preview(66.9%) 같은 모델을 능가한다.
핵심 요약
- 대규모 언어 모델의 복잡한 추론에는 방대한 양의 학습 데이터가 필요하다는 것이 통념이다.
- 대규모 데이터셋을 수집하고 학습하는 데 높은 연산 비용과 자원이 든다.
- 크고 큐레이션되지 않은 추론 데이터셋으로 학습된 모델은 일반화가 제한되고 암기 가능성이 있다.
- 최소한의 데이터셋을 활용하는, LIMO라는 이름의 데이터 효율적 지도 미세조정(SFT) 접근법이다.
- 문제 난이도에 대한 다단계 필터링과 추론 사슬 품질에 대한 상세한 규칙 기반 점수화를 통해, 고도로 큐레이션된 800개 수학 추론 문제 데이터셋을 구축했다.
- 학습 과정은 기본 모델이 사전 학습된 지식을 활용해 메타 추론 작업을 응집된 사슬로 통합할 수 있게 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.