SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 996
- 분야
- AI / General
- arXiv 번호
- 2608.23493
이 논문은 모델이 자기 실패 기록을 반성해 '반성 노트'를 만들고 이를 훈련 신호로 쓰는 방법으로, 희소한 보상 문제를 풀어 적은 컴퓨팅으로 큰 성과를 냈다.
이 논문은 한마디로 '스스로 반성하며 배우는' 강화학습 방법이다. SRPO는 완료된 트레젝토리를 모델 스스로 분석해 간결한 반성 조각을 만들고, 이 반성을 조건으로 한 교사 점수를 학생 롤아웃의 토큰별 밀집 신호로 쓴다. 8B 모델로 수학 AIME'24 73.3%를 대규모 SFT 대비 8% 연산만에 달성했고, 긴 과제(WebShop·ALFWorld·SWE-Bench-Lite)에서도 성공률이 크게 올랐다. 교사 역할도 모델 자신이 맡기 때문에, 모델이 갖고 있지 않은 지식이 필요한 문제에서는 반성이 도움이 되지 않았다.
핵심 요약
- 완주한 트레젝토리에서 스스로 반성 요약을 뽑아, 이를 조건으로 한 밀집 토큰급 훈련 신호를 만들었다.
- 더 큰 교사 모델이나 외부 크리틱, 별도 보상 모델 없이 모델 자신만으로 돌아가서, 상위 모델을 쓰기 어려운 곳에서도 후속 학습을 적용할 수 있다.
- Qwen3-8B로 AIME'24 73.3%를 달성했고, 확장 SFT 대비 8%(0.08배) 연산만 썼다.
- WebShop 64.7%, ALFWorld 76.8%, SWE-Bench-Lite 31.2%로 긴 과제 성공률도 크게 올렸다.
- 다만 반성이 늘 통하지는 않아서, 실패한 반성의 42%는 두루뭉술한 조언, 35%는 원인 오진, 23%는 모델이 애초에 갖고 있지 않은 지식이 필요한 문제였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.