CUA-Gym: Scaling Verifiable Training Environments and Tasks for Computer-Use Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 242
- 분야
- AI / General
- arXiv 번호
- 2605.25624
CUA-GYM은 컴퓨터 사용 에이전트를 위한 대규모 검증 가능 RLVR(검증 가능한 보상을 통한 강화학습) 학습 데이터를 생성하는 에이전트 파이프라인을 제시하며, 110개의 실제 및 합성 환경에 걸쳐 32,112개의 과제로 구성된다.
CUA-Gym은 컴퓨터 사용 에이전트를 위한 지시, 실행 환경 상태, 검증 가능한 보상 함수를 함께 만드는 자동 합성 파이프라인이다. 생성 에이전트가 초기 상태와 정답 상태를 만들고 별도의 판별 에이전트가 보상 코드를 작성하며, 실행 결과가 맞을 때까지 조정한 뒤 투표와 실제 에이전트 롤아웃으로 다시 거른다. 이 과정으로 110개 환경에 걸친 32,112개의 검증된 RLVR 학습 항목과 94개 모의 웹 애플리케이션 묶음을 구축했다. CUA-Gym으로 학습한 A3B와 A17B 모델은 OSWorld-Verified에서 각각 62.1%와 72.6%를 기록했고, 학습에 쓰지 않은 WebArena에서도 개선됐다. 다만 보상은 최종 상태를 중심으로 검증하므로 잘못된 중간 과정을 구별하기 어렵고, 모의 환경과 실제 소프트웨어 사이의 차이 및 남은 보상 해킹 가능성도 고려해야 한다.
핵심 요약
- Discriminator는 Generator의 구현 세부사항으로부터 격리되어 있어 오직 과제 t와 그 결과로 나타난 환경 상태만 본다. 그런 다음 초기 상태에 대해서는 0.0을, 골든 상태에 대해서는 1.0을 반환해야 하는 reward.py 스크립트를 작성한다.
- Qwen3.5-35B 모델(A3B)은 성공률을 54.5%에서 62.1%로 향상시켰다.
- Qwen3.5-397B 모델(A17B)은 72.6%의 성공률에 도달했으며, 이는 10퍼센트포인트가 넘는 증가다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.