Pixel-Space Diffusion Transformers

발행일
출처
arXiv
논문 번호
673
분야
Computer Vision
arXiv 번호
2607.17585

VAE 압축 없이 원본 픽셀에서 바로 이미지를 만드는 픽셀공간 확산 트랜스포머 연구들을 처음으로 한데 모아 정리한 서베이 논문이다.

잠재확산모델은 VAE로 이미지를 압축한 뒤 그 공간에서 잡음을 지우는 2단계 방식이라 계산은 싸지만, 고정된 압축기가 미세 질감과 경계를 버리고 복원 목표와 생성 목표가 어긋나는 한계가 있다. 이 논문은 그 병목을 없애고 원본 픽셀을 직접 다루는 픽셀공간 확산 트랜스포머 계열을 세 축으로 정리한다. 구조 설계, 연속 생성 수식, 통합 멀티모달 모델이 그 세 축이다. 저자들은 픽셀, 텍스트, 작업 조건을 하나의 토큰 공간에 올려 단일 트랜스포머로 처리하면 시각 이해와 생성의 간극을 줄일 수 있다고 본다.

핵심 요약

  • 잠재확산은 VAE의 손실 압축 때문에 고주파 질감과 날카로운 경계가 되돌릴 수 없이 사라지는 정보 병목을 안고 있다고 지적한다.
  • 복원을 잘하도록 학습한 압축기와 생성을 잘하도록 학습한 확산모델의 목표가 서로 달라 끝까지 한 번에 최적화하기 어렵다는 점을 핵심 문제로 짚는다.
  • 픽셀공간으로 돌아가면 단일 단계 학습이 가능해지지만, 잡음 일정, 손실 가중, 토큰 효율, 확장 가능한 구조 설계라는 새 난제가 생긴다고 정리한다.
  • 최근 방법들은 깨끗한 원본을 바로 예측하는 x0 예측 방식으로 학습 경로를 데이터 표면에 고정해 수렴을 앞당긴다고 소개한다.
  • 다중 가지 구조, 주파수 분리, 세밀한 토큰화로 전역 구조와 미세 질감을 서로 다른 부품이 나눠 맡게 하는 흐름을 정리한다.
  • 픽셀과 텍스트와 작업 조건을 공유 토큰 공간에 올려 하나의 트랜스포머로 학습하면 이해와 생성을 함께 하는 통합 시각 기반모델로 갈 수 있다고 전망한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)