WithEveryone: Unified Planning and Identity Grounding for Group Image Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 965
- 분야
- Computer Vision
- arXiv 번호
- 2608.20336
참고 사진 5~10명을 주면 각자 얼굴이 살아있는 단체사진 한 장을 만들어주는 이미지 생성 기술이다.
이 논문은 한마디로 여러 사람(최대 10명)의 얼굴 정체성을 보존하는 단체 이미지 생성 프레임워크다. 핵심은 '누가 어디에 서는지'를 먼저 계획하는 레이아웃 사고연쇄(Layout CoT)와, 얼굴 위치 주석으로 직접 감독하는 LG-ID 손실이다. 기존 방식은 생성된 얼굴끼리 매칭하는 게 흔들려서 사람 수가 늘면 무너졌는데, 이 논문은 위치를 먼저 정해버려서 그 문제 자체를 없앴다. 그 결과 GPT-Image 2보다 얼굴 유사도가 높고(0.499 vs 0.462), 참고 얼굴 복붙 흔적은 3배 적었다(0.055 vs 0.169).
핵심 요약
- 참고 인물 5~10명의 단체사진을 한 번에 생성하는 통합 모델을 만들었다. 기존 공개 기술은 최대 4명이 한계였다.
- 인물별 위치를 계획하는 Layout CoT와 위치 기반 ID 손실(LG-ID)로, 인원이 늘어나도 얼굴 매칭이 안 무너지게 했다.
- 대상 얼굴 유사도 0.499로 GPT-Image 2(0.462)를 앞서고, 복붙 아티팩트는 0.169→0.055로 3배 낮췄다.
- 요청 인물 커버리지 97.3%, 중복 생성률 2.8%로 비교 시스템 중 가장 균형 잡힌 결과를 냈다.
- 남은 오류의 원인이 이미지 생성이 아니라 '계획' 단계임을 분리 진단해 다음 개선 방향을 제시했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.