UI-TARS: Pioneering Automated GUI Interaction with Native Agents
- 발행일
- 출처
- arXiv
- 논문 번호
- 062
- 분야
- GUI Agents
- arXiv 번호
- 2501.12326
이 논문은 모듈형 프레임워크나 외부 API에 의존하지 않고 스크린샷을 인식해 사람과 유사한 상호작용을 수행하는 네이티브 GUI 에이전트 모델 UI-TARS를 소개한다.
이 논문은 모듈형 프레임워크나 외부 API에 의존하지 않고 스크린샷을 인식해 사람과 유사한 상호작용을 수행하는 네이티브 GUI 에이전트 모델 UI-TARS를 소개한다.
핵심 요약
- 기존 GUI 에이전트는 확장성을 제약하는 텍스트 기반 표현과 모듈형 프레임워크에 크게 의존한다.
- 엔드투엔드 GUI 에이전트를 학습시키기 위한 대규모 고품질 데이터가 부족하다.
- 복잡한 GUI 시나리오는 현재 접근법이 갖추지 못한 고도의 인식, 추론, 조율 능력을 요구한다.
- 스크린샷을 직접 처리해 인터페이스와 상호작용하는 엔드투엔드 모델 UI-TARS를 개발했다.
- 자동 수집과 큐레이션을 통해 인식, 그라운딩, 동작 트레이스를 위한 대규모 데이터셋을 구축했다.
- 사고 증강과 반성 튜닝을 통해 시스템 2 추론 능력을 통합했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.