An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 923
- 분야
- Computer Vision
- arXiv 번호
- 2608.16887
픽셀에서 처음부터 배우게 하기보다, 압축된 표현에서 먼저 익힌 뒤 픽셀 생성으로 옮기는 편이 더 빠르고 실용적이라는 대규모 실험이다.
이 논문은 한마디로 텍스트 이미지 확산 모델을 픽셀 공간에서 효율적으로 학습하는 방법을 실험으로 찾는다. 같은 구조, 자료와 계산량을 둔 비교에서 픽셀 공간 사전학습은 잠재 공간 학습보다 훨씬 느리게 수렴했다. 이에 잠재 공간 체크포인트에서 시작하고 자체 생성 이미지와 실사진을 섞은 뒤, 픽셀 예측 목표와 가벼운 DiP 디코더로 전환한다. 이어 패치 크기를 16에서 32로 단계적으로 키우고 생성 단계를 줄여 두 모델 계열에서 3.18배에서 4.75배의 추론 속도 향상을 얻었다. 다만 잠재 공간 사전학습에 의존하며 모든 평가 지표에서 기존 잠재 모델보다 좋아진 것은 아니다.
핵심 요약
- 같은 Z-Image 구조와 200억 쌍이 넘는 동일 자료 조건에서 예측 공간만 바꾼 실험은 픽셀 사전학습의 느린 수렴을 보여줬다.
- DiP 디코더는 1,024 해상도와 단일 H800에서 디코더만 실행했을 때 매개변수 1,009만 개와 6.02밀리초를 사용했고, GenEval 0.7545와 DPG 87.54를 기록했다.
- 잡음 크기 실험에서는 2가 GenEval 0.7545와 DPG 87.54로 가장 좋았다. 이론에서 나온 값 8은 각각 0.7316과 85.64에 그쳤다.
- 1,024 해상도, 단일 H800과 100회 모델 계산 조건에서 Z-Image 생성 시간은 20.12초에서 4.56초로 줄었고 GenEval은 0.7510에서 0.7644로 높아졌다.
- 같은 Z-Image 비교에서 OneIG는 0.566에서 0.564로, LongText는 0.9332에서 0.9252로 조금 낮아졌다. 검증된 모델 계열도 Z-Image와 FLUX2-klein 두 종류다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.