Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation

발행일
출처
arXiv
논문 번호
503
분야
Computer Vision
arXiv 번호
2606.26907

실제 사용자 요청의 맥락 부족(Context Gap)을 해결하기 위해 plan, reason, search, memory, feedback을 통합한 에이전트 이미지 생성 프레임워크. IA-Bench 벤치마크를 새로 제안했다.

Qwen-Image-Agent는 T2I 모델이 실제 요청에서 직면하는 context gap(사용자 맥락과 생성에 필요한 충분한 맥락 간 불일치)를 해결하기 위해, Context-Aware Planning과 Context Grounding을 통합한 에이전트 프레임워크다. Planning은 information/content/generation 3수준으로 동작하고, Grounding은 reason, search, memory, feedback 4개 소스에서 맥락을 수집한다. IA-Bench(4개 역량, 17개 과제, 730 인스턴스)에서 SOTA를 달성했으며, MindBench와 WISE-Verified에서도 기존 baseline을 능가했다.

핵심 요약

  • T2I 모델의 실세 과제 실패 원인을 'Context Gap'으로 정의하고, 이를 해결하는 에이전트 패러다임을 제안했다.
  • Context-Aware Planning을 3단계(information-level, content-level, generation-level)로 계층화하여 맥락 부재 식별→수집→할당을 수행한다.
  • Context Grounding은 reasoning, web/image search, memory, feedback 4개 채널에서 맥락을 수집한다.
  • IA-Bench(Plan/Reason/Search/Memory 4개 역량, 17개 과제, 730 테스트 인스턴스, 1801개 체크리스트 항목)를 새로 구성했다.
  • MLLM backbone 지능이 전체 시스템 성능에 결정적이며, backbone 교체 시 대부분의 메트릭에서 큰 저하가 발생한다.
  • 이미지 검색 과용이 오히려 생성 품질을 저하함을 발견하고, generator 능력에 맞춘 검색 경계 설정이 중요함을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)