PiD: Fast and High-Resolution Latent Decoding with Pixel Diffusion

발행일
출처
arXiv
논문 번호
223
분야
Computer Vision
arXiv 번호
2605.23902

PiD는 잠재 디코딩을 조건부 픽셀 확산 과정으로 재정식화하여, 잠재-픽셀 매핑과 공간적 업샘플링을 단일 생성 모듈로 통합한다.

PiD는 잠재 표현을 픽셀로 복원하는 과정을 조건부 픽셀 확산으로 바꿔 디코딩과 고해상도 업샘플링을 하나로 합친 모델이다. 잡음 수준을 아는 가벼운 어댑터가 잠재 정보를 픽셀 확산 백본에 주입해, 완전히 잡음 제거되지 않은 잠재에서도 이미지를 만들 수 있다. DMD2 증류로 추론을 네 단계로 줄였고 VAE 잠재뿐 아니라 SigLIP과 DINOv2 같은 의미 잠재에도 적용된다. RTX 5090에서 512×512 잠재를 2048×2048 픽셀로 1초 안에 디코딩했으며, 계단식 확산 초해상도 방식보다 약 6배 빠르면서 시각 품질도 높였다고 보고했다. 다만 잠재 확산을 너무 일찍 끝내면 의미 구조가 덜 형성되고, 생성형 디코더가 원래 잠재에 없던 세부 내용을 추가할 수 있어 종료 시점과 충실도 사이의 조절이 중요하다.

핵심 요약

  • 픽셀 확산 사전: rectified-flow 목표를 사용하여 고해상도 합성에 최적화된 1.3B 파라미터 트랜스포머다.
  • 잠재 어댑터: 입력 잠재 변수 z를 처리하여 픽셀 트랜스포머의 공간 격자에 정렬하는 합성곱 네트워크다. 이 어댑터는 잠재 변수의 전역 구조와 의미 정보가 보존되도록 보장한다.
  • 시그마 인식 게이팅: 모델이 잠재 조건에 의존하는 정도와 자체 생성 사전에 의존하는 정도를 조절하는 핵심 혁신이다. 잠재 변수의 영향은 게이팅 함수를 사용해 그 노이즈 수준 σ에 따라 조절된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)