QuasiMoTTo: Quasi-Monte Carlo Test-Time Scaling
- 발행일
- 출처
- arXiv
- 논문 번호
- 557
- 분야
- Machine Learning
- arXiv 번호
- 2607.01179
Quasi-Monte Carlo를 활용해 동일한 분포를 유지하면서도 샘플 다양성을 높이는 추론/RL 샘플링 효율화 기법.
추론 계산 스케일링과 강화학습에서 독립 샘플링의 중복성 문제를 해결하기 위해 QuasiMoTTo를 제안한다. 핵심 아이디어는 준몬테카를로(QMC) 방법으로 균등분포를 더 고르게 펼친 뒤, 역CDF 샘플링으로 정확한 LM 샘플을 생성하는 것이다. 각 샘플은 여전히 LM 분포를 따르지만 배치 전체로는 더 높은 커버리지를 달성한다. 4개 추론 벤치마크에서 동일 pass@k를 25-47% 적은 샘플로 달성했고, GRPO RL에서는 50% 적은 스텝으로 목표 성능에 도달했다.
핵심 요약
- autoregressive sampling을 inverse-CDF 샘플링으로 재매개화하여 QMC 균등수를 LM 샘플로 변환
- 각 샘플은 marginally 정확(동일 LM 분포)이면서 batch 차원에서는 음의 상관관계로 커버리지 증대
- pass@k: 4개 추론 벤치마크에서 동일 성능을 25-47% 적은 샘플로 달성
- GRPO RL: 동일 pass@1을 50% 적은 훈련 스텝으로 달성, zero-variance group 비율 감소
- lattice > stratified > Sobol > i.i.d. 순으로 커버리지 증가, 자유도-커버리지 트레이드오프 정량화
- 한계: 1-2B 모델/짧은 출력에만 검증, long-CoT로의 확장은 future work
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.