SPIRAL: Learning to Search and Aggregate

발행일
출처
arXiv
논문 번호
485
분야
AI / General
arXiv 번호
2606.23595

순차·병렬·집계 3가지 추론 컴퓨트 원시를 통합 강화학습으로 훈련하는 SPIRAL 프레임워크로, GRPO 대비 최대 11배 스케일링 효율을 달성한다.

추론 모델이 테스트 시간에 사용하는 세 가지 컴퓨트 원시(순차 추론, 병렬 샘플링, 집계)를 통합 훈련하는 SPIRAL을 제안한다. 병렬 트레이스 생성에는 집합 강화학습(set RL)을, 집계 트레이스에는 표준 강화학습을 적용하여, 모델이 독립적으로 유용한 추론 트레이스 세트를 생성하고 이를 효과적으로 종합하는 능력을 학습한다. 수학 추론 벤치마크에서 GRPO 대비 최대 11배의 스케일링 효율과 15% 높은 성능을 달성했으며, 복합 test-time 전략(재귀적 자기 집계 등)에서 특히 강력한 이점을 보인다.

핵심 요약

  • 순차·병렬·집계 3종 추론 컴퓨트를 단일 강화학습 파이프라인에서 통합 최적화하는 최초의 프레임워크
  • 집합 강화학습(set RL)으로 병렬 트레이스가 집계에 집단적으로 유용하도록 학습
  • GRPO 대비 pass@k에서 최대 11배 스케일링 효율, 병렬+집계 동시 스케일링 시 15% 더 높은 성능
  • 기존 훈련 패러다임은 순차 추론만 최적화하여 테스트 시간 스캐폴드와의 간극이 존재했음을 지적
  • Qwen3-4B-Instruct 기반 실험으로 검증, 8B+ 파라미터 확장을 향후 과제로 명시

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)