StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling

Published
Source
arXiv
Paper number
662
Field
Computer Vision
arXiv ID
2607.15619

Key points

  • It removes ambiguity in natural-language instructions by assigning an identifier to each reference image in a dictionary-style format.
  • It builds a new structured training dataset from real, high-quality images.
  • It proposes a dedicated benchmark for multi-reference evaluation.
  • It consistently outperforms existing methods on complex multi-reference scenarios.

Paper links

External research summaries. These are not HDATF publications or measured product results.

Read original (opens in a new tab)