Pixel-Space Diffusion Transformers
- 발행일
- 출처
- arXiv
- 논문 번호
- 673
- 분야
- Computer Vision
- arXiv 번호
- 2607.17585
VAE 압축 없이 원본 픽셀에서 바로 이미지를 만드는 픽셀공간 확산 트랜스포머 연구들을 처음으로 한데 모아 정리한 서베이 논문이다.
잠재확산모델은 VAE로 이미지를 압축한 뒤 그 공간에서 잡음을 지우는 2단계 방식이라 계산은 싸지만, 고정된 압축기가 미세 질감과 경계를 버리고 복원 목표와 생성 목표가 어긋나는 한계가 있다. 이 논문은 그 병목을 없애고 원본 픽셀을 직접 다루는 픽셀공간 확산 트랜스포머 계열을 세 축으로 정리한다. 구조 설계, 연속 생성 수식, 통합 멀티모달 모델이 그 세 축이다. 저자들은 픽셀, 텍스트, 작업 조건을 하나의 토큰 공간에 올려 단일 트랜스포머로 처리하면 시각 이해와 생성의 간극을 줄일 수 있다고 본다.
핵심 요약
- 잠재확산은 VAE의 손실 압축 때문에 고주파 질감과 날카로운 경계가 되돌릴 수 없이 사라지는 정보 병목을 안고 있다고 지적한다.
- 복원을 잘하도록 학습한 압축기와 생성을 잘하도록 학습한 확산모델의 목표가 서로 달라 끝까지 한 번에 최적화하기 어렵다는 점을 핵심 문제로 짚는다.
- 픽셀공간으로 돌아가면 단일 단계 학습이 가능해지지만, 잡음 일정, 손실 가중, 토큰 효율, 확장 가능한 구조 설계라는 새 난제가 생긴다고 정리한다.
- 최근 방법들은 깨끗한 원본을 바로 예측하는 x0 예측 방식으로 학습 경로를 데이터 표면에 고정해 수렴을 앞당긴다고 소개한다.
- 다중 가지 구조, 주파수 분리, 세밀한 토큰화로 전역 구조와 미세 질감을 서로 다른 부품이 나눠 맡게 하는 흐름을 정리한다.
- 픽셀과 텍스트와 작업 조건을 공유 토큰 공간에 올려 하나의 트랜스포머로 학습하면 이해와 생성을 함께 하는 통합 시각 기반모델로 갈 수 있다고 전망한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.