StructGen: Disambiguating Multi-Reference Image Generation via Structured Context Modeling
- Published
- Source
- arXiv
- Paper number
- 662
- Field
- Computer Vision
- arXiv ID
- 2607.15619
Key points
- It removes ambiguity in natural-language instructions by assigning an identifier to each reference image in a dictionary-style format.
- It builds a new structured training dataset from real, high-quality images.
- It proposes a dedicated benchmark for multi-reference evaluation.
- It consistently outperforms existing methods on complex multi-reference scenarios.
Paper links
External research summaries. These are not HDATF publications or measured product results.