OSWorld2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks

발행일
출처
arXiv
논문 번호
531
분야
AI / General
arXiv 번호
2606.29537

장시간 실제 컴퓨터 사용 워크플로우 108개로 구성된 벤치마크. 최고 모델도 20.6%만 완료하며, 숨겨진 상태 복원·동적 환경 대응이 핵심 병목임을 드러냄.

OSWorld 2.0은 실제 전문가 워크플로우를 기반으로 한 108개 장기 호라이즌 컴퓨터 사용 태스크 벤치마크다. 중앙값 1.6시간이 소요되는 태스크들로 구성되며, Claude Opus 4.8도 500 스텝 예산에서 20.6%만 완료한다. 단순 GUI 조작이 아닌 숨겨진 상태 복원, 동적 환경 변화, 교차 출처 추론 등 실제 워크플로우의 구조적 난이도를 측정한다.

핵심 요약

  • 108개 장기 호라이즌 워크플로우, 인간 중앙값 1.6시간 / 에이전트 평균 318 툴콜 소요
  • Claude Opus 4.8(max thinking) 20.6% 완료, GPT-5.5 13% 수준 - 토큰 효율은 더 좋음
  • 10가지 챌린지 현상 정의: 동적 환경, 교차 출처 추론, 숨겨진 상태 추론, 충돌 해소 등
  • 31개 자체 호스팅 웹 서비스(이메일·뱅킹·채팅 등)로 현실적 환경 구성
  • 핵심 실패 원인: 제약 조건 망각, 중간 정보 누락, 추측, 검증 생략 (기본 GUI 조작 아님)
  • 에이전트가 자체 예산의 7% 미만만 오류 감지·수정에 사용

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)