WithEveryone: Unified Planning and Identity Grounding for Group Image Generation

발행일
출처
arXiv
논문 번호
965
분야
Computer Vision
arXiv 번호
2608.20336

참고 사진 5~10명을 주면 각자 얼굴이 살아있는 단체사진 한 장을 만들어주는 이미지 생성 기술이다.

이 논문은 한마디로 여러 사람(최대 10명)의 얼굴 정체성을 보존하는 단체 이미지 생성 프레임워크다. 핵심은 '누가 어디에 서는지'를 먼저 계획하는 레이아웃 사고연쇄(Layout CoT)와, 얼굴 위치 주석으로 직접 감독하는 LG-ID 손실이다. 기존 방식은 생성된 얼굴끼리 매칭하는 게 흔들려서 사람 수가 늘면 무너졌는데, 이 논문은 위치를 먼저 정해버려서 그 문제 자체를 없앴다. 그 결과 GPT-Image 2보다 얼굴 유사도가 높고(0.499 vs 0.462), 참고 얼굴 복붙 흔적은 3배 적었다(0.055 vs 0.169).

핵심 요약

  • 참고 인물 5~10명의 단체사진을 한 번에 생성하는 통합 모델을 만들었다. 기존 공개 기술은 최대 4명이 한계였다.
  • 인물별 위치를 계획하는 Layout CoT와 위치 기반 ID 손실(LG-ID)로, 인원이 늘어나도 얼굴 매칭이 안 무너지게 했다.
  • 대상 얼굴 유사도 0.499로 GPT-Image 2(0.462)를 앞서고, 복붙 아티팩트는 0.169→0.055로 3배 낮췄다.
  • 요청 인물 커버리지 97.3%, 중복 생성률 2.8%로 비교 시스템 중 가장 균형 잡힌 결과를 냈다.
  • 남은 오류의 원인이 이미지 생성이 아니라 '계획' 단계임을 분리 진단해 다음 개선 방향을 제시했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)