TTRL: Test-Time Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 064
- 분야
- RL / Inference
- arXiv 번호
- 2504.16084
TTRL은 다수결 투표에서 도출한 자체 생성 보상을 사용해, 레이블이 없는 테스트 데이터에 대한 강화학습을 통해 대규모 언어 모델이 스스로 개선하도록 하는 프레임워크다.
TTRL은 다수결 투표에서 도출한 자체 생성 보상을 사용해, 레이블이 없는 테스트 데이터에 대한 강화학습을 통해 대규모 언어 모델이 스스로 개선하도록 하는 프레임워크다. 이 접근법은 자기 강화 학습 루프를 형성함으로써 복잡한 추론 과제에서 성능을 크게 끌어올리며, 한 모델은 AIME 2024에서 211%의 향상을 달성했다.
핵심 요약
- 추론 과제에 대규모 언어 모델용 강화학습을 적용하는 것은 보상 추정에 필요한 사람이 주석을 단 정답 레이블의 높은 비용과 희소성으로 인해 병목에 부딪힌다.
- 기존 LLM용 RL 방법은 지도된 보상 신호에 크게 의존하기 때문에, 새로 마주하거나 레이블이 없는 테스트 데이터에서 지속적인 자기 개선이 어렵다.
- 추론 시점에 명시적 보상 신호를 얻을 수 없다는 점은 사람의 개입 없이 LLM이 새로운 분포에 적응하고 일반화를 향상시키는 능력을 제한한다.
- RL을 사용해 테스트 시점에 LLM이 파라미터를 업데이트하고 일반화를 향상시킬 수 있게 하는 프레임워크인 테스트 시점 강화학습(TTRL)을 도입한다.
- 모델 출력을 반복 샘플링하고 다수결 투표로 합의 출력을 도출함으로써, 명시적 정답 레이블 없이 보상 신호를 생성한다.
- 각 샘플 출력이 다수결로 결정된 의사 레이블과 일치하는지에 따라 규칙 기반 이진 보상을 계산하며, 이를 GRPO와 같은 RL 알고리즘으로 모델 정책을 최적화하는 데 사용한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.