Reinforcement Learning from Rich Feedback with Distributional DAgger
- 발행일
- 출처
- arXiv
- 논문 번호
- 311
- 분야
- Machine Learning
- arXiv 번호
- 2606.05152
추론 모델은 빠르게 발전해 왔지만, 지배적인 검증 가능 보상 기반 강화학습(RLVR) 방법론은 놀라울 정도로 협소하게 남아 있다. 즉, 여러 응답을 샘플링하고 최종 답이 맞는지를 나타내는 단일 비트로 각 응답에 보상을 준다.
검증 가능한 보상 기반 강화학습은 보통 최종 답의 정오만 한 비트로 주지만, 실제 환경에는 실행 기록, 도구 출력, 전문가 수정처럼 더 풍부한 피드백이 있다. DistIL은 현재 정책이 방문한 상태에서 피드백을 아는 교사의 분포를 받아 배우는 DAgger의 분포형 변형이다. 순방향 교차 엔트로피를 사용해 뒤에서 나타날 교사와 학생의 차이를 앞선 결정까지 전달한다. 저자들은 역방향 KL이나 젠슨-섀넌 기반 자기 증류가 더 나쁜 행동의 확률을 높일 수도 있지만, DistIL은 단조 정책 개선과 후회 한계를 보장한다고 분석했다. 과학 추론, 코딩, 어려운 수학 실험에서 RLVR과 자기 증류 비교 방법보다 좋은 성능을 보여, 풍부한 피드백을 추론 학습에 쓰는 방법을 제시한다.
핵심 요약
- 이 논문은 역방향 KL이나 Jensen-Shannon에 기반한 기존 자기 증류 목적 함수를 사용하는 RL이 단조적 정책 개선을 보장하지 못함을 보인다. 즉, 전문가가 더 높은 보상을 갖더라도 그 업데이트가 더 나쁜 행동에 대한 확률을 높일 수 있다.
- 이와 대조적으로, 순방향 교차 엔트로피가 단조적 정책 개선을 허용하며 후회(regret)에 대한 보장을 누림을 보인다.
- 또한 이 목적 함수가 교사 가중 성공 가능도의 하한을 최적화하여 Pass@N을 개선함을 보인다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.