LADDER: Self-Improving LLMs Through Recursive Problem Decomposition

발행일
출처
arXiv
논문 번호
043
분야
Math Reasoning
arXiv 번호
2503.00735

Tufa Labs는 복잡한 문제의 점진적으로 더 단순한 변형을 재귀적으로 생성하고 강화 학습으로 학습함으로써 대규모 언어 모델이 자율적으로 문제 해결 능력을 향상시킬 수 있게 하는 프레임워크 LADDER를 개발했다.

Tufa Labs는 복잡한 문제의 점진적으로 더 단순한 변형을 재귀적으로 생성하고 강화 학습으로 학습함으로써 대규모 언어 모델이 자율적으로 문제 해결 능력을 향상시킬 수 있게 하는 프레임워크 LADDER를 개발했다. 이 접근은 3B Llama 모델의 적분 정확도를 1퍼센트에서 82퍼센트로 끌어올렸으며, Test-Time Reinforcement Learning과 결합했을 때 7B Qwen 모델이 MIT Integration Bee에서 90퍼센트를 달성해 GPT-4o와 OpenAI의 o1 같은 더 큰 모델을 능가하게 했다.

핵심 요약

  • 대규모 언어 모델(LLM)을 위한 강화 학습은 학습 작업에 난이도의 점진적 구배를 요구하지만, 이는 종종 확보되지 않아 학습 정체나 파국적 성능 저하로 이어진다.
  • 수학과 같은 복잡한 추론 영역은 모델이 풀 수 있는 문제와 현재 풀 수 없는 문제 사이의 큰 격차 때문에 상당한 난제를 제기한다.
  • 기존 LLM 학습 및 개선 방법은 종종 방대한 인간 큐레이션 데이터셋이나 지속적인 인간 감독·피드백에 크게 의존한다.
  • LADDER 프레임워크는 재귀적 문제 분해를 가능하게 하며, LLM이 변환 라이브러리와 유도된 프롬프팅을 사용해 복잡하고 현재 풀 수 없는 문제의 점진적으로 더 단순한 변형으로 이루어진 트리를 자율적으로 생성한다.
  • 견고한 수치 검증 프레임워크가 해답의 정확성을 평가해 강화 학습을 위한 명확하고 객관적인 보상 신호를 제공한다.
  • Test-Time Reinforcement Learning(TTRL)은 추론 시점에 이전에 풀지 못한 테스트 문제에 대해 문제별로 집중된 변형을 생성해 LADDER를 확장하며, 개별적인 어려운 질문에 대한 표적적·동적 학습을 가능하게 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)