StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

발행일
출처
arXiv
논문 번호
662
분야
Computer Vision
arXiv 번호
2607.15619

여러 참조 이미지를 조합해 새 이미지를 생성할 때, 구조화된 딕셔너리 형식으로 지시어를 주어 모호함을 없앤 멀티레퍼런스 이미지 생성 프레임워크다.

이 논문은 한마디로 여러 참조 이미지의 속성을 조합해 새 이미지를 만들 때, 자연어 대신 구조화된 딕셔너리 형식을 써서 정확도를 높인 방법이다. 각 이미지에 식별자를 부여하고, 지시어에서 ID로 직접 참조하게 한다. 고품질 실제 이미지로 구성된 데이터셋과 전용 벤치마크도 함께 제안했다.

핵심 요약

  • 딕셔너리 형식으로 각 참조 이미지에 식별자를 부여해 자연어 지시어의 모호함을 제거했다.
  • 실제 고품질 이미지 기반의 구조화된 학습 데이터셋을 새로 구축했다.
  • 멀티레퍼런스 평가용 전용 벤치마크를 제안했다.
  • 기존 방법들 대비 복잡한 다중 참조 상황에서 일관되게 더 나은 결과를 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)