OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
- 발행일
- 출처
- arXiv
- 논문 번호
- 531
- 분야
- AI / General
- arXiv 번호
- 2606.29537
장시간 실제 컴퓨터 사용 워크플로우 108개로 구성된 벤치마크. 최고 모델도 20.6%만 완료하며, 숨겨진 상태 복원·동적 환경 대응이 핵심 병목임을 드러냄.
OSWorld 2.0은 실제 전문가 워크플로우를 기반으로 한 108개 장기 호라이즌 컴퓨터 사용 태스크 벤치마크다. 중앙값 1.6시간이 소요되는 태스크들로 구성되며, Claude Opus 4.8도 500 스텝 예산에서 20.6%만 완료한다. 단순 GUI 조작이 아닌 숨겨진 상태 복원, 동적 환경 변화, 교차 출처 추론 등 실제 워크플로우의 구조적 난이도를 측정한다.
핵심 요약
- 108개 장기 호라이즌 워크플로우, 인간 중앙값 1.6시간 / 에이전트 평균 318 툴콜 소요
- Claude Opus 4.8(max thinking) 20.6% 완료, GPT-5.5 13% 수준 - 토큰 효율은 더 좋음
- 10가지 챌린지 현상 정의: 동적 환경, 교차 출처 추론, 숨겨진 상태 추론, 충돌 해소 등
- 31개 자체 호스팅 웹 서비스(이메일·뱅킹·채팅 등)로 현실적 환경 구성
- 핵심 실패 원인: 제약 조건 망각, 중간 정보 누락, 추측, 검증 생략 (기본 GUI 조작 아님)
- 에이전트가 자체 예산의 7% 미만만 오류 감지·수정에 사용
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.