GenRouter: Unified Workflow Routing for Agentic Image Generation

발행일
출처
arXiv
논문 번호
925
분야
Computer Vision
arXiv 번호
2608.16721

그림 요청마다 같은 무거운 절차를 돌리지 않고, 요청 난이도에 맞춰 검색, 추론, 검증 과정과 이미지 모델을 골라 주는 라우터다.

이 논문은 한마디로 이미지 생성 요청마다 알맞은 작업 흐름과 모델을 고르는 GenRouter를 제안한다. GenCanvas는 문장 다듬기, 분해, 검색, 추론, 도구 호출, 검증, 수정과 밑그림이라는 8개 기본 기능을 정해진 작업 흐름으로 조합한다. GenRouter는 요청을 7개 요구 점수로 분석하고, 과거 실행 기록으로 품질과 비용과 시간을 예상한 뒤 성능이 낮으면서 더 비싼 후보를 제거한다. Qwen-Image 조건의 5개 평가 평균은 71.3으로 GEMS의 68.7보다 높았고, 도구 실행 비용은 59.70달러에서 2.97달러로 줄었다. 다만 이 비용에는 이미지 모델 자체의 생성 비용이 들어 있지 않다.

핵심 요약

  • GenCanvas는 가벼운 직접 생성부터 검색, 공간 밑그림과 반복 검증을 쓰는 무거운 흐름까지 정해진 틀로 제공한다.
  • GenRouter는 요구 분석, 후보 제거, 경험 기록 매칭과 품질 대비 비용 필터 순서로 알맞은 흐름을 고른다.
  • 주요 비교는 Qwen-Image-2512와 Z-Image-Turbo를 생성기로 쓰고 공통 언어 및 시각 도구를 Kimi K2.5로 맞춘 조건이다.
  • 9개 벤치마크에서 뽑은 500개 혼합 문장 실험에서는 세 벤치마크의 경험을 쌓은 뒤 점수가 73.5에서 75.2로 오르고 비용과 시간은 각각 8.7퍼센트와 7.9퍼센트 줄었다.
  • 새 벤치마크마다 평가와 분리된 보정 문장 10개를 쓰며, 각 문장에 가능한 작업 흐름과 생성기 조합을 모두 실행한다. 비용과 시간 가중치도 사람이 정하므로 완전한 무준비 적용으로 보기는 어렵다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)