SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL
- 발행일
- 출처
- arXiv
- 논문 번호
- 618
- 분야
- AI / General
- arXiv 번호
- 2607.11185
컴퓨터 사용 에이전트(CUA)를 위한 온라인 RL 스케일링 프레임워크. VERIGEN으로 24K+ 검증 가능한 태스크를 생성하고 Frontier Sampling으로 효율화. OSWorld 68.7% 달성.
SCALECUA는 컴퓨터 사용 에이전트(CUA)의 온라인 RL을 스케일링하기 위한 통합 프레임워크로, VERIGEN이라는 end-to-end 검증 가능 태스크 생성 파이프라인(24K+ 태스크, ~3K 고품질 RL 태스크)과 학습 효율을 극대화하는 Frontier Sampling을 결합한다. Visual Context Segmentation으로 2.83배 훈련 가속을 달성했으며, 9B 모델로 OSWorld 68.7%, ScienceBoard 54.0%를 기록하며 오픈소스 CUA 중 새로운 SOTA를 수립했다.
핵심 요약
- VeriGen은 Docker 상호작용과 여러 에이전트의 피드백으로 검증 가능한 컴퓨터 사용 과제를 자동 합성한다.
- 과제별 현재 능력 경계에 실행을 배분하는 Frontier Sampling과 최근 화면만 나누어 처리하는 Visual Context Segmentation을 사용했다.
- 2만4천 개가 넘는 검증 가능 과제와 약 3천 개의 고품질 강화학습 과제를 만들고 학습 속도를 2.83배 높였다.
- ScaleCUA는 OSWorld 68.7%와 ScienceBoard 54.0%를 기록해 공개 컴퓨터 사용 에이전트의 대규모 온라인 학습에 쓸 수 있다.
- 각 실행은 50턴으로 제한되고 평가는 Ubuntu 데스크톱 중심이어서 초장기 작업과 Windows·macOS로의 일반화는 확인되지 않았다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.