QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling

발행일
출처
arXiv
논문 번호
557
분야
Machine Learning
arXiv 번호
2607.01179

Quasi-Monte Carlo를 활용해 동일한 분포를 유지하면서도 샘플 다양성을 높이는 추론/RL 샘플링 효율화 기법.

추론 계산 스케일링과 강화학습에서 독립 샘플링의 중복성 문제를 해결하기 위해 QuasiMoTTo를 제안한다. 핵심 아이디어는 준몬테카를로(QMC) 방법으로 균등분포를 더 고르게 펼친 뒤, 역CDF 샘플링으로 정확한 LM 샘플을 생성하는 것이다. 각 샘플은 여전히 LM 분포를 따르지만 배치 전체로는 더 높은 커버리지를 달성한다. 4개 추론 벤치마크에서 동일 pass@k를 25-47% 적은 샘플로 달성했고, GRPO RL에서는 50% 적은 스텝으로 목표 성능에 도달했다.

핵심 요약

  • autoregressive sampling을 inverse-CDF 샘플링으로 재매개화하여 QMC 균등수를 LM 샘플로 변환
  • 각 샘플은 marginally 정확(동일 LM 분포)이면서 batch 차원에서는 음의 상관관계로 커버리지 증대
  • pass@k: 4개 추론 벤치마크에서 동일 성능을 25-47% 적은 샘플로 달성
  • GRPO RL: 동일 pass@1을 50% 적은 훈련 스텝으로 달성, zero-variance group 비율 감소
  • lattice > stratified > Sobol > i.i.d. 순으로 커버리지 증가, 자유도-커버리지 트레이드오프 정량화
  • 한계: 1-2B 모델/짧은 출력에만 검증, long-CoT로의 확장은 future work

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)