GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation

발행일
출처
arXiv
논문 번호
212
분야
Computer Vision
arXiv 번호
2605.21605

GenEvolve는 최선-최악 생성 궤적에서 구조화된 시각적 경험을 증류함으로써 외부 도구와 내부 지식을 조율하는 자기 진화형 이미지 생성 에이전트를 개발하며, 이를 통해 내부 및 외부 지식 집약적 이미지 생성 벤치마크 모두에서 성능을 향상시킨다.

복잡한 이미지 생성 요청은 모델 내부 능력만으로 처리하기보다 검색과 참고 이미지, 생성 도구를 함께 조율해야 하는 경우가 많다. GenEvolve는 각 생성 시도를 증거 수집, 참고 자료 선택, 생성 기능 호출, 프롬프트 구성으로 이어지는 도구 사용 궤적으로 표현한다. 같은 요청에서 나온 좋은 궤적과 나쁜 궤적의 차이를 구조화된 시각 경험으로 만들고, 이를 정보가 더 많은 교사 분기에만 제공한다. 학생 모델은 자신의 현재 정책이 만든 결과를 따라가며 교사의 토큰별 분포를 학습해 검색과 참고 자료 선택 방식을 내부화한다. 공개 벤치마크와 새로 만든 GenEvolve-Bench에서 강한 기준 모델보다 큰 향상을 보였고, 성과는 이들 벤치마크 평가를 중심으로 보고되었다.

핵심 요약

  • 실패 메모리는 실패 회피에 관한 교훈이다.
  • 프롬프트 풀은 2만 개의 요청을 사실과 사건 같은 지식 기반(Knowledge-Anchored)과 공간 구성, 텍스트 레이아웃 같은 품질 기반(Quality-Anchored)으로 나눈다.
  • 교사 궤적: 강력한 모델을 사용해 초기 성공 궤적을 생성한 뒤, 정확성을 위해 VLM 심판이 이를 검수한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)