UI-TARS: Pioneering Automated GUI Interaction with Native Agents

발행일
출처
arXiv
논문 번호
062
분야
GUI Agents
arXiv 번호
2501.12326

이 논문은 모듈형 프레임워크나 외부 API에 의존하지 않고 스크린샷을 인식해 사람과 유사한 상호작용을 수행하는 네이티브 GUI 에이전트 모델 UI-TARS를 소개한다.

이 논문은 모듈형 프레임워크나 외부 API에 의존하지 않고 스크린샷을 인식해 사람과 유사한 상호작용을 수행하는 네이티브 GUI 에이전트 모델 UI-TARS를 소개한다.

핵심 요약

  • 기존 GUI 에이전트는 확장성을 제약하는 텍스트 기반 표현과 모듈형 프레임워크에 크게 의존한다.
  • 엔드투엔드 GUI 에이전트를 학습시키기 위한 대규모 고품질 데이터가 부족하다.
  • 복잡한 GUI 시나리오는 현재 접근법이 갖추지 못한 고도의 인식, 추론, 조율 능력을 요구한다.
  • 스크린샷을 직접 처리해 인터페이스와 상호작용하는 엔드투엔드 모델 UI-TARS를 개발했다.
  • 자동 수집과 큐레이션을 통해 인식, 그라운딩, 동작 트레이스를 위한 대규모 데이터셋을 구축했다.
  • 사고 증강과 반성 튜닝을 통해 시스템 2 추론 능력을 통합했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)