DiffusionBench: On Holistic Evaluation of Diffusion Transformers

발행일
출처
arXiv
논문 번호
487
분야
Computer Vision
arXiv 번호
2606.24888

Diffusion Transformer 평가가 ImageNet에만 편중된 문제를 지적하고, T2I와의 순위 상관관계가 없음을 21개 모델 실험으로 입증하여 DiffusionBench 통합 벤치마크를 제안한다.

Diffusion Transformer(DiT) 연구가 ImageNet 클래스 조건부 생성 평가에만 편중되어 있으며, 이것이 진정한 생성 모델링 진전을 반영하는지 의문을 제기한다. NANOGEN이라는 통합 훈련/평가 프레임워크를 구축하여 ImageNet과 text-to-image(T2I)를 거의 동일한 설정에서 훈련할 수 있게 만들고, 21개 잠재 확산 모델을 훈련했다. 결과적으로 ImageNet 순위와 T2I 순위 사이에 강한 상관관계가 없음(Pearson r = -0.377 ~ -0.580)을 발견했다. 이를 바탕으로 두 태스크를 통합한 DiffusionBench를 제안한다.

핵심 요약

  • ImageNet과 T2I를 12줄 설정 변경으로 전환 가능한 NANOGEN 통합 훈련/평가 프레임워크 구축
  • 21개 잠재 확산 모델 훈련 후 ImageNet 순위와 T2I 순위의 Pearson 상관계수가 -0.377 ~ -0.580로 무상관 확인
  • ImageNet FID 개선이 T2I 품질 개선으로 이어지지 않는다는 실증적 증거 제공
  • RAE, VAE, pixel-space, MeanFlow를 모두 지원하는 통합 코드베이스 공개
  • DiffusionBench: ImageNet + T2I 결과를 통합한 holistic 벤치마크로 향후 DiT 연구의 기본 보고 권장

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)