Qwen-Image-Agent: Bridging the Context Gap in Real-World Image Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 503
- 분야
- Computer Vision
- arXiv 번호
- 2606.26907
실제 사용자 요청의 맥락 부족(Context Gap)을 해결하기 위해 plan, reason, search, memory, feedback을 통합한 에이전트 이미지 생성 프레임워크. IA-Bench 벤치마크를 새로 제안했다.
Qwen-Image-Agent는 T2I 모델이 실제 요청에서 직면하는 context gap(사용자 맥락과 생성에 필요한 충분한 맥락 간 불일치)를 해결하기 위해, Context-Aware Planning과 Context Grounding을 통합한 에이전트 프레임워크다. Planning은 information/content/generation 3수준으로 동작하고, Grounding은 reason, search, memory, feedback 4개 소스에서 맥락을 수집한다. IA-Bench(4개 역량, 17개 과제, 730 인스턴스)에서 SOTA를 달성했으며, MindBench와 WISE-Verified에서도 기존 baseline을 능가했다.
핵심 요약
- T2I 모델의 실세 과제 실패 원인을 'Context Gap'으로 정의하고, 이를 해결하는 에이전트 패러다임을 제안했다.
- Context-Aware Planning을 3단계(information-level, content-level, generation-level)로 계층화하여 맥락 부재 식별→수집→할당을 수행한다.
- Context Grounding은 reasoning, web/image search, memory, feedback 4개 채널에서 맥락을 수집한다.
- IA-Bench(Plan/Reason/Search/Memory 4개 역량, 17개 과제, 730 테스트 인스턴스, 1801개 체크리스트 항목)를 새로 구성했다.
- MLLM backbone 지능이 전체 시스템 성능에 결정적이며, backbone 교체 시 대부분의 메트릭에서 큰 저하가 발생한다.
- 이미지 검색 과용이 오히려 생성 품질을 저하함을 발견하고, generator 능력에 맞춘 검색 경계 설정이 중요함을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.