Vector Policy Optimization: Training for Diversity Improves Test-Time Search
- 발행일
- 출처
- arXiv
- 논문 번호
- 206
- 분야
- Machine Learning
- arXiv 번호
- 2605.22817
Vector Policy Optimization(VPO)은 벡터 값 보상 구조와 확률적 스칼라화를 활용해 대규모 언어 모델이 다양한 후보 해를 생성하도록 학습시킨다.
일반적인 언어 모델 후학습은 하나의 보상을 최대화해 답변 분포를 좁히므로, 여러 후보를 탐색하는 추론 시점 검색에 필요한 다양성이 부족해질 수 있다. Vector Policy Optimization은 테스트 사례별 정답이나 여러 사용자 선호처럼 보상을 벡터로 표현하고 서로 다른 보상 절충에 특화된 해답 묶음을 만들도록 학습한다. 이 방식은 GRPO의 이점 추정 부분을 바꿔 넣을 수 있도록 설계되어 기존 강화학습 흐름에 적용하기 쉽다. 네 가지 과제에서 강한 단일 보상 기준선과 같거나 더 좋은 검색 성능을 냈고, 검색 예산이 커질수록 차이가 더 벌어졌다. 진화형 검색에서는 GRPO 모델이 풀지 못한 문제도 해결했으며, 결과는 다양한 후보 생성 자체를 후학습 목표로 삼을 필요성을 보여준다.
핵심 요약
- Maze Navigation은 에이전트가 위험 요소인 용암을 피하면서 금과 다이아몬드 같은 아이템을 모아야 하는 합성 과제다. 목표들이 의도적으로 상충하도록 설계되어 있어서, 예를 들어 금이 종종 용암 근처에 있다. 파레토 프론티어 커버리지를 검증하기에 완벽한 시험대가 된다.
- MuSiQue는 다중 홉 QA 과제로, 최종 답변의 정확도와 중간 추론 단계에 대한 인용의 정확성 모두에 기반해 보상이 부여되는 질의응답 과제다.
- ToolRL은 모델이 구조적 제약을 충족하면서 동시에 높은 속성 수준 정확도를 달성해야 하는 함수 호출 벤치마크다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.