The Art of Building Verifiers for Computer Use Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 139
- 분야
- Agents / Evaluation
- arXiv 번호
- 2604.06240
Microsoft Research와 Browserbase 연구진은 과정 보상과 결과 보상을 분리하고 시각적 컨텍스트를 효과적으로 관리해 Computer Use Agent 궤적을 신뢰성 있게 평가하도록 설계된 시스템 Universal Verifier를 개발했다.
Microsoft Research와 Browserbase 연구진은 과정 보상과 결과 보상을 분리하고 시각적 컨텍스트를 효과적으로 관리해 Computer Use Agent 궤적을 신뢰성 있게 평가하도록 설계된 시스템 Universal Verifier를 개발했다. 이 검증기는 기존 방법에 비해 인간 판단과의 정렬을 우수하게 달성하고 위양성률을 크게 낮췄으며, CUAVerifierBench 데이터셋도 함께 도입했다.
핵심 요약
- Computer Use Agent(CUA)의 과제 성공을 신뢰성 있게 검증하는 것은 길고 시각적으로 풍부하며 모호한 궤적 때문에 어렵다.
- CUA 궤적에 대한 사람의 주석 작업은 까다롭고 비용이 많이 들며, 미묘하거나 일시적인 실패를 놓치는 경우가 많다.
- 기존 자동 검증 시스템은 토큰 제한, 컨텍스트 관리, 복잡한 환경에서 성공이나 실패를 정확히 귀속하는 데 어려움을 겪어 높은 위양성률을 초래한다.
- 견고한 검증을 위한 네 가지 원칙에 기반한, CUA 궤적용 평가 시스템 Universal Verifier(UV)를 도입했다.
- 이는 환각을 탐지하기 위해 신중하게 구성된 비중첩 루브릭과 2패스 채점을 사용하고, 평가를 과정 보상과 이진 결과 라벨로 분리한다.
- UV는 제어 가능한 에이전트 실패와 제어 불가능한 환경 요인을 구별하며, 스크린샷 증거의 멀티모달 컨텍스트 관리를 위해 분할 정복 전략을 활용한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.