SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

발행일
출처
arXiv
논문 번호
618
분야
AI / General
arXiv 번호
2607.11185

컴퓨터 사용 에이전트(CUA)를 위한 온라인 RL 스케일링 프레임워크. VERIGEN으로 24K+ 검증 가능한 태스크를 생성하고 Frontier Sampling으로 효율화. OSWorld 68.7% 달성.

SCALECUA는 컴퓨터 사용 에이전트(CUA)의 온라인 RL을 스케일링하기 위한 통합 프레임워크로, VERIGEN이라는 end-to-end 검증 가능 태스크 생성 파이프라인(24K+ 태스크, ~3K 고품질 RL 태스크)과 학습 효율을 극대화하는 Frontier Sampling을 결합한다. Visual Context Segmentation으로 2.83배 훈련 가속을 달성했으며, 9B 모델로 OSWorld 68.7%, ScienceBoard 54.0%를 기록하며 오픈소스 CUA 중 새로운 SOTA를 수립했다.

핵심 요약

  • VeriGen은 Docker 상호작용과 여러 에이전트의 피드백으로 검증 가능한 컴퓨터 사용 과제를 자동 합성한다.
  • 과제별 현재 능력 경계에 실행을 배분하는 Frontier Sampling과 최근 화면만 나누어 처리하는 Visual Context Segmentation을 사용했다.
  • 2만4천 개가 넘는 검증 가능 과제와 약 3천 개의 고품질 강화학습 과제를 만들고 학습 속도를 2.83배 높였다.
  • ScaleCUA는 OSWorld 68.7%와 ScienceBoard 54.0%를 기록해 공개 컴퓨터 사용 에이전트의 대규모 온라인 학습에 쓸 수 있다.
  • 각 실행은 50턴으로 제한되고 평가는 Ubuntu 데스크톱 중심이어서 초장기 작업과 Windows·macOS로의 일반화는 확인되지 않았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)