TRACE-Bench: Decomposing and Diagnosing Multi-Reference Image Generation

발행일
출처
arXiv
논문 번호
938
분야
Computer Vision
arXiv 번호
2608.16765

여러 참고 이미지를 조합하는 능력을 네 가지 기본 연산으로 나눠, 모델이 무엇에서 실패했는지 찾는 TRACE-Bench를 제안했다.

이 논문은 한마디로 여러 참고 이미지를 사용하는 이미지 생성 평가를 작업 이름이 아니라 필요한 능력으로 나눈다. TRACE-Bench는 대상을 유지하는 Anchor, 속성을 떼어내는 Disentangle, 그 속성을 목표에 붙이는 Apply, 여러 대상을 장면에 놓는 Compose의 네 연산을 정의한다. 각 요청을 이 연산의 수식으로 표현하고 연산 칸 수 1개부터 8개까지 난도를 조절한다. 9개 모델을 평가하자 장면 구성보다 속성을 분리하고 올바른 대상에 붙이는 능력이 더 큰 약점으로 나타났다. 다만 전체 평가는 시각 언어 모델의 채점에 의존하므로 사람 평가와의 일치도를 함께 봐야 한다.

핵심 요약

  • 요청을 대상 유지, 속성 분리, 속성 적용과 장면 구성의 네 연산으로 표현한다. 같은 수식 구조를 문제 생성, 항목별 채점과 실패 원인 추적에 모두 사용한다.
  • 자료는 약 1,600개 평가 사례, 수식 틀 631개와 참고 이미지 약 4,000개로 구성된다. 연산 칸 수 1개부터 8개까지 복잡도를 조절한다.
  • 상용 모델 4개와 공개 모델 5개를 비교했다. Nano Banana 2의 네 연산 평균이 0.8205로 가장 높았지만 속성 분리는 0.7384, 속성 적용은 0.7989에 머물렀다.
  • Emu3.5 사례 200개를 더 단순한 하위 문제로 쪼개자 전체 진단 결과의 38.5퍼센트가 여러 참고 대상을 함께 구성할 때 생긴 간섭으로 분류됐다. 자동 분석과 사람의 실패 위치 판단은 82.6퍼센트 일치했다.
  • 전체 평가는 Gemini-2.5-Pro가 체크리스트를 채점한다. 200개 사례에서 두 모델이 만든 출력 400개를 사람이 다시 확인했을 때 네 채점 모델의 항목별 일치율은 85.4퍼센트에서 88.4퍼센트였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)