ComputerRL: Scaling End-to-End Online Reinforcement Learning for Computer Use Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 075
- 분야
- Computer Use Agents
- arXiv 번호
- 2508.14040
COMPUTERRL 프레임워크는 컴퓨터 사용 에이전트를 위한 온라인 강화학습을 확장하여, API-GUI 상호작용 패러다임, 확장 가능한 분산 환경, Entropulse 훈련 전략을 통합함으로써 OSWorld 벤치마크에서 48.9%, 새로운 OfficeWorld 벤치마크에서 43.3%라는 새로운 SOTA 정확도를 달성한다.
COMPUTERRL 프레임워크는 컴퓨터 사용 에이전트를 위한 온라인 강화학습을 확장하여, API-GUI 상호작용 패러다임, 확장 가능한 분산 환경, Entropulse 훈련 전략을 통합함으로써 OSWorld 벤치마크에서 48.9%, 새로운 OfficeWorld 벤치마크에서 43.3%라는 새로운 SOTA 정확도를 달성한다.
핵심 요약
- 그래픽 사용자 인터페이스는 본질적으로 인간 중심으로 설계되어 기계의 상호작용을 복잡하게 만들기 때문에, 견고한 LLM 기반 GUI 에이전트 개발은 어렵다.
- 행동 복제 같은 기존 방법은 확장성 문제, 제한된 일반화, 다양하고 복잡한 데스크톱 과제에 대한 부실한 오류 복구 능력이라는 한계를 겪는다.
- 데스크톱 자동화에 강화학습을 적용하는 것은 높은 계산 부담, 느린 수렴 속도, 불안정성, 그리고 장기 훈련 중 정책이 탐색 역량을 상실하는 경향(엔트로피 붕괴)으로 인해 제약을 받아 왔다.
- API-GUI 상호작용 패러다임은 직접적인 GUI 상호작용과 프로그래밍 방식의 API 호출을 통합하며, 효율성과 다재다능함을 높이기 위해 API 개발을 위한 LLM 기반 자동화 워크플로우로 이를 보완한다.
- 효율적인 데이터 수집을 위해 수천 개의 동시 가상 데스크톱 환경을 오케스트레이션할 수 있는, 분산 다중 노드 클러스터링 인프라를 갖춘 확장 가능하고 안정적인 Ubuntu 환경이 개발되었다.
- 다중 LLM 기반 행동 복제, 검증 가능한 보상을 갖춘 스텝 수준 Group Relative Policy Optimization(GRPO), 그리고 주기적 RL-SFT 교대를 통한 지속적 탐색을 위한 Entropulse 전략을 특징으로 하는 완전 비동기 RL 프레임워크가 구현되었다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.