Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems
- 발행일
- 출처
- arXiv
- 논문 번호
- 044
- 분야
- RL / Agents
- arXiv 번호
- 2502.19328
Tsinghua University 연구진은 인간 선호와 자동 검증 에이전트를 결합한 새로운 보상 모델링 프레임워크 REWARDAGENT를 제안한다. LLM 학습과 응답 선택에서 우수한 성능을 달성하는 동시에 더 나은 언어 모델 개발을 위한 더 신뢰할 수 있는 토대를 제공한다.
Tsinghua University 연구진은 인간 선호와 자동 검증 에이전트를 결합한 새로운 보상 모델링 프레임워크 REWARDAGENT를 제안한다. LLM 학습과 응답 선택에서 우수한 성능을 달성하는 동시에 더 나은 언어 모델 개발을 위한 더 신뢰할 수 있는 토대를 제공한다.
핵심 요약
- 기존 보상 모델은 인간 선호에 지나치게 의존해 잠재적 편향과 정확성 문제를 일으킨다.
- 현재 접근들은 사실 정확성과 지시 준수에 대한 체계적 검증이 부족하다.
- 전통적 보상 모델은 여러 중요한 평가 기준을 동시에 포착하지 못하는 경우가 많다.
- 전문화된 검증 에이전트와 인간 선호 신호를 결합한 멀티 에이전트 보상 시스템을 개발했다.
- 어떤 검증 에이전트를 호출할지 지능적으로 결정하는 라우터 구성 요소를 만들었다.
- 여러 평가 출처의 점수를 결합하는 통합 메커니즘을 구현했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.