UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning

발행일
출처
arXiv
논문 번호
568
분야
LLMs / NLP
arXiv 번호
2607.04425

멀티티처 온폴리시 증류(MOPD)를 GUI 에이전트 지속 학습에 도입해 크로스 플랫폼 행동 간섭을 해결한다. OSWorld 38.2%, MobileWorld 12.0% 성공률을 달성했다.

UI-MOPD는 데스크톱과 모바일 환경 간 행동 규칙 충돌과 치명적 망각 문제를 해결하기 위해 플랫폼별 교사 모델을 동적 선택하여 온폴리시 증류를 수행한다. Uni-GUI 데이터셋(약 10K 고품질 크로스플랫폼 궤적)을 구축하고, 플랫폼 조건부 라우팅으로 단일 8B 학생 모델이 두 플랫폼에서 동시 향상을 달성했다.

핵심 요약

  • 멀티티처 온폴리시 증료(MOPD)를 GUI 에이전트 크로스플랫폼 지속학습에 최초 도입
  • Uni-GUI: 약 10K 고품질 크로스플랫폼 GUI 상호작용 궤적 데이터셋 구축
  • 플랫폼 라우터가 환경에 따라 교사를 동적 선택, 행동 규칙 혼합과 치명적 망각 방지
  • OSWorld 38.2%(+12.7%), MobileWorld 12.0%(+55.8%) 상대 향상으로 단일 8B 모델이 양 플랫폼에서 동시 개선
  • GUI 그라운딩 능력도 보존: ScreenSpot-Pro 43.14%, ScreenSpotV2 90.88%로 기반 모델 대비 최소 손실

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)