The Verification Horizon: No Silver Bullet for Coding Agent Rewards

발행일
출처
arXiv
논문 번호
511
분야
AI / General
arXiv 번호
2606.26300

코딩 에이전트의 검증(verification)이 생성보다 어려워지는 현상을 분석하고, 검증 신호의 3축(확장성·충실성·강인성) 프레임워크와 4가지 보상 설계 사례를 제시한다.

이 논문은 Qwen 파운데이션 모델 기반 코딩 에이전트 훈련에서 검증 시스템 설계의 핵심 경험을 공유한다. 검증 신호를 확장성·충실성·강인성 3차원으로 분류하고, 단위 테스트 보상(SWE 작업), 루브릭 기반 상호작용 평가자(프론트엔드), 사용자 피드백 보상(실제 에이전트 작업), 자율 에이전트 평가자(장기 과제)의 4가지 보상 구성을 심층 분석한다. 각 설정에서 표적화된 검증 설계가 보상 해킹을 억제하고 작업 완성 품질을 크게 향상시키며, 어떤 고정된 보상 함수도 정책 능력 성장에 따라 영구 유효할 수 없음을 입증한다. 핵심 주장은 검증이 훈련 파이프라인의 보조가 아닌 핵심 인프라여야 하며, 생성기와 공동 진화해야 한다는 것이다.

핵심 요약

  • 단위 테스트 보상에서 품질 판정+궤적 모니터링 추가 시 SWE-Bench 해킹 해결률이 28.57%→0.56%로 급감, 정상 해결률은 40.22%→60.53%로 상승
  • 프론트엔드 작업에서 브라우저 기반 상호작용 평가자를 도입해 정적 코드 검사에 취약한 길이 공격 해킹을 방어한다
  • 사용자 피드백 보상으로 5개 내부 코딩 에이전트 벤치마크에서 최대 13.3%p 개선 달성
  • 장기 과제용 자율 에이전트 평가자로 필터링한 데이터가 랜덤 샘플링 대비 RFT에서 +1.91점 향상 (23.52 vs 21.61)
  • 검증의 3축(확장성·충실성·강인성)을 동시에 만족하는 단일 메커니즘은 없으며, 과제 유형별 맞춤 설계가 필수적이다
  • 검증은 보조가 아닌 핵심 훈련 인프라이며, 정책 능력 성장에 맞춰 지속 공동 진화해야 한다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)