ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

발행일
출처
arXiv
논문 번호
827
분야
Computer Vision
arXiv 번호
2608.04436

이미지 생성 AI가 검색 도구를 쓰고 직접 그림을 그리는 것까지 하나의 정책으로 통합한 완전 에이전트 이미지 생성 모델이다.

이 논문은 한마디로 이미지 생성 AI에 추론, 검색 도구 사용, 그리고 그림 그리기까지 하나의 모델이 통합하게 만든 연구다. 기존에는 검색 에이전트가 프롬프트를 고치고 외부 생성기에 넘기는 식이었다. ToolArtist는 Emu3.5라는 통합 멀티모달 모델(UMM)을 후처리해서 추론→검색→그리기를 한 번에 한다. RL 단계에서는 의도 보상과 품질 보상을 결합한 RAD-GRPO로 최적화했다.

핵심 요약

  • 추론, 외부 도구(텍스트/이미지 검색), 이미지 생성을 하나의 UMM 정책으로 통합한 최초의 완전 에이전트 이미지 생성 모델이다.
  • SFT에서 이미지 생성 도구를 숨기고 결과 이미지만 남겨 UMM이 직접 그리게 하는 광학적 변환 기법을 개발했다.
  • 의도 보상(intent)과 품질 보상(quality)을 결합한 RAD-GRPO로 추론-검색-그리기 전체 궤적을 강화학습한다.
  • 7,132개 고품질 SFT 트레이터리만으로 WISE, WorldGenBench-Humanities에서 부분 에이전트 방식들을 능가했다.
  • 학습 데이터와 전체 후처리 인프라를 공개 개방했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)