LIMO: Less is More for Reasoning

발행일
출처
arXiv
논문 번호
027
분야
Reasoning / Data Efficiency
arXiv 번호
2502.03387

상하이교통대학교와 SII-GAIR의 LIMO(Less is More for Reasoning) 연구는 대규모 언어 모델을 위한 지도 미세조정 방법을 개발해, 신중하게 큐레이션된 800개 예시의 최소 데이터셋만으로 고급 수학적 추론을 달성할 수 있음을 입증했다.

상하이교통대학교와 SII-GAIR의 LIMO(Less is More for Reasoning) 연구는 대규모 언어 모델을 위한 지도 미세조정 방법을 개발해, 신중하게 큐레이션된 800개 예시의 최소 데이터셋만으로 고급 수학적 추론을 달성할 수 있음을 입증했다. 이 접근법은 여러 벤치마크에 걸쳐 평균 78.1%의 성능을 달성해, 훨씬 더 큰 데이터셋으로 미세조정된 OpenAI-o1-preview(61.1%)와 QwQ-32B-Preview(66.9%) 같은 모델을 능가한다.

핵심 요약

  • 대규모 언어 모델의 복잡한 추론에는 방대한 양의 학습 데이터가 필요하다는 것이 통념이다.
  • 대규모 데이터셋을 수집하고 학습하는 데 높은 연산 비용과 자원이 든다.
  • 크고 큐레이션되지 않은 추론 데이터셋으로 학습된 모델은 일반화가 제한되고 암기 가능성이 있다.
  • 최소한의 데이터셋을 활용하는, LIMO라는 이름의 데이터 효율적 지도 미세조정(SFT) 접근법이다.
  • 문제 난이도에 대한 다단계 필터링과 추론 사슬 품질에 대한 상세한 규칙 기반 점수화를 통해, 고도로 큐레이션된 800개 수학 추론 문제 데이터셋을 구축했다.
  • 학습 과정은 기본 모델이 사전 학습된 지식을 활용해 메타 추론 작업을 응집된 사슬로 통합할 수 있게 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)