GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation
- 발행일
- 출처
- arXiv
- 논문 번호
- 212
- 분야
- Computer Vision
- arXiv 번호
- 2605.21605
GenEvolve는 최선-최악 생성 궤적에서 구조화된 시각적 경험을 증류함으로써 외부 도구와 내부 지식을 조율하는 자기 진화형 이미지 생성 에이전트를 개발하며, 이를 통해 내부 및 외부 지식 집약적 이미지 생성 벤치마크 모두에서 성능을 향상시킨다.
복잡한 이미지 생성 요청은 모델 내부 능력만으로 처리하기보다 검색과 참고 이미지, 생성 도구를 함께 조율해야 하는 경우가 많다. GenEvolve는 각 생성 시도를 증거 수집, 참고 자료 선택, 생성 기능 호출, 프롬프트 구성으로 이어지는 도구 사용 궤적으로 표현한다. 같은 요청에서 나온 좋은 궤적과 나쁜 궤적의 차이를 구조화된 시각 경험으로 만들고, 이를 정보가 더 많은 교사 분기에만 제공한다. 학생 모델은 자신의 현재 정책이 만든 결과를 따라가며 교사의 토큰별 분포를 학습해 검색과 참고 자료 선택 방식을 내부화한다. 공개 벤치마크와 새로 만든 GenEvolve-Bench에서 강한 기준 모델보다 큰 향상을 보였고, 성과는 이들 벤치마크 평가를 중심으로 보고되었다.
핵심 요약
- 실패 메모리는 실패 회피에 관한 교훈이다.
- 프롬프트 풀은 2만 개의 요청을 사실과 사건 같은 지식 기반(Knowledge-Anchored)과 공간 구성, 텍스트 레이아웃 같은 품질 기반(Quality-Anchored)으로 나눈다.
- 교사 궤적: 강력한 모델을 사용해 초기 성공 궤적을 생성한 뒤, 정확성을 위해 VLM 심판이 이를 검수한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.