ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents

발행일
출처
arXiv
논문 번호
075
분야
Computer Use Agents
arXiv 번호
2508.14040

COMPUTERRL 프레임워크는 컴퓨터 사용 에이전트를 위한 온라인 강화학습을 확장하여, API-GUI 상호작용 패러다임, 확장 가능한 분산 환경, Entropulse 훈련 전략을 통합함으로써 OSWorld 벤치마크에서 48.9%, 새로운 OfficeWorld 벤치마크에서 43.3%라는 새로운 SOTA 정확도를 달성한다.

COMPUTERRL 프레임워크는 컴퓨터 사용 에이전트를 위한 온라인 강화학습을 확장하여, API-GUI 상호작용 패러다임, 확장 가능한 분산 환경, Entropulse 훈련 전략을 통합함으로써 OSWorld 벤치마크에서 48.9%, 새로운 OfficeWorld 벤치마크에서 43.3%라는 새로운 SOTA 정확도를 달성한다.

핵심 요약

  • 그래픽 사용자 인터페이스는 본질적으로 인간 중심으로 설계되어 기계의 상호작용을 복잡하게 만들기 때문에, 견고한 LLM 기반 GUI 에이전트 개발은 어렵다.
  • 행동 복제 같은 기존 방법은 확장성 문제, 제한된 일반화, 다양하고 복잡한 데스크톱 과제에 대한 부실한 오류 복구 능력이라는 한계를 겪는다.
  • 데스크톱 자동화에 강화학습을 적용하는 것은 높은 계산 부담, 느린 수렴 속도, 불안정성, 그리고 장기 훈련 중 정책이 탐색 역량을 상실하는 경향(엔트로피 붕괴)으로 인해 제약을 받아 왔다.
  • API-GUI 상호작용 패러다임은 직접적인 GUI 상호작용과 프로그래밍 방식의 API 호출을 통합하며, 효율성과 다재다능함을 높이기 위해 API 개발을 위한 LLM 기반 자동화 워크플로우로 이를 보완한다.
  • 효율적인 데이터 수집을 위해 수천 개의 동시 가상 데스크톱 환경을 오케스트레이션할 수 있는, 분산 다중 노드 클러스터링 인프라를 갖춘 확장 가능하고 안정적인 Ubuntu 환경이 개발되었다.
  • 다중 LLM 기반 행동 복제, 검증 가능한 보상을 갖춘 스텝 수준 Group Relative Policy Optimization(GRPO), 그리고 주기적 RL-SFT 교대를 통한 지속적 탐색을 위한 Entropulse 전략을 특징으로 하는 완전 비동기 RL 프레임워크가 구현되었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)