Agentic Reward Modeling: Integrating Human Preferences with Verifiable Correctness Signals for Reliable Reward Systems

발행일
출처
arXiv
논문 번호
044
분야
RL / Agents
arXiv 번호
2502.19328

Tsinghua University 연구진은 인간 선호와 자동 검증 에이전트를 결합한 새로운 보상 모델링 프레임워크 REWARDAGENT를 제안한다. LLM 학습과 응답 선택에서 우수한 성능을 달성하는 동시에 더 나은 언어 모델 개발을 위한 더 신뢰할 수 있는 토대를 제공한다.

Tsinghua University 연구진은 인간 선호와 자동 검증 에이전트를 결합한 새로운 보상 모델링 프레임워크 REWARDAGENT를 제안한다. LLM 학습과 응답 선택에서 우수한 성능을 달성하는 동시에 더 나은 언어 모델 개발을 위한 더 신뢰할 수 있는 토대를 제공한다.

핵심 요약

  • 기존 보상 모델은 인간 선호에 지나치게 의존해 잠재적 편향과 정확성 문제를 일으킨다.
  • 현재 접근들은 사실 정확성과 지시 준수에 대한 체계적 검증이 부족하다.
  • 전통적 보상 모델은 여러 중요한 평가 기준을 동시에 포착하지 못하는 경우가 많다.
  • 전문화된 검증 에이전트와 인간 선호 신호를 결합한 멀티 에이전트 보상 시스템을 개발했다.
  • 어떤 검증 에이전트를 호출할지 지능적으로 결정하는 라우터 구성 요소를 만들었다.
  • 여러 평가 출처의 점수를 결합하는 통합 메커니즘을 구현했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)