TTPO: Test-Time Policy Optimization
- 발행일
- 출처
- arXiv
- 논문 번호
- 1030
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.27448
정답 라벨 없이 다수결 가짜 정답만으로 테스트타임 학습을 하는 방법. 동의한 롤아웃은 증류, 반대한 롤아웃은 페널티로 나눠 처리해 노이즈에 강하다.
이 논문은 한마디로 정답 없이 모델 스스로 뽑은 다수결 가짜 정답만으로 수학 추론 실력을 올리는 학습법 TTPO를 제안했다. 경쟁급 난제에서는 가짜 정답의 85%가 틀리지만, 가짜 정답에 반대표를 던진 롤아웃(답변 후보)도 약 79%는 실제로 틀렸다는 비대칭성을 이용한다. 그래서 가짜 정답에 동의한 롤아웃은 증류로, 반대한 롤아웃은 그룹 RL 페널티로 갈라서 처리한다. 라벨 없이도 라벨 학습과 동등한 성능을 냈고, 순수 테스트타임 학습에서 Qwen3-1.7B를 38.0%에서 45.2%로 올렸다.
핵심 요약
- 경쟁급 난제에서 가짜 정답이 85% 틀려도, 반대한 롤아웃의 79%는 실제로 틀렸다는 비대칭 구조를 발견했다.
- 이 비대칭을 이용해 동의 롤아웃은 증류, 반대 롤아웃은 그룹 RL 페널티로 처리하는 TTPO를 만들었다.
- 라벨 전혀 없이 5개 경쟁급 벤치마크에서 라벨 기반 학습(OPSD)과 동등 이상 성능을 냈다.
- 순수 테스트타임 학습 설정에서 Qwen3-1.7B 정확도를 38.0%에서 45.2%로 올렸다.
- 사고모드(긴 추론) 없이도 25.2~36.4%p 오르고, 한 벤치마크 학습이 다른 벤치마크로 일반화됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.