Qwen-CUA: Native Computer Use for (almost) Everything

발행일
출처
arXiv
논문 번호
812
분야
Machine Learning
arXiv 번호
2608.02352

이 논문은 스크린샷만 보고 키보드/마우스를 조작하는 Qwen 컴퓨터 사용 에이전트를 10만 vCPU 규모로 학습시켜 8개 벤치마크에서 SOTA를 달성했다.

이 논문은 한마디로 화면만 보고 사람처럼 컴퓨터를 쓰는 AI 에이전트를 대규모로 학습시킨 연구다. Qwen-CUA는 397B-A17B MoE 구조로, DOM이나 접근성 API 없이 스크린샷만 입력받아 키보드/마우스 행동을 출력한다. 10만 vCPU 규모의 클라우드 환경에서 4만 개의 검증 가능한 태스크로 강화학습했다. OSWorld-Verified 86.2%를 달성해 GPT-5.5, Claude Opus 4.8과 경쟁한다.

핵심 요약

  • 스크린샷만 입력받아 키보드/마우스를 조작하는 네이티브 컴퓨터 사용 에이전트를 397B-A17B MoE로 학습했다.
  • 최대 20개 스크린샷을 유지하면서 오래된 것은 블록으로 묶어 KV 캐시 효율을 높였다.
  • 약 10만 vCPU, 4만 개 검증 태스크, 수만 개 동시 환경으로 대규모 강화학습을 수행했다.
  • OSWorld-Verified 86.2%로 8개 벤치마크에서 Qwen3.7을 일관되게 앞섰다.
  • 공격 성공률을 36.6%에서 16.4%로 낮춰 안전성도 개선했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)