Improved Baselines with Representation Autoencoders
- 발행일
- 출처
- arXiv
- 논문 번호
- 200
- 분야
- Computer Vision
- arXiv 번호
- 2605.18324
이 연구는 확산 모델을 위한 Representation Autoencoder(RAE)를 크게 향상시켜, 다층 인코더 특징을 활용하고 효율적인 자기 안내를 가능하게 함으로써 10배 이상 빠른 수렴과 향상된 생성·재구성 품질을 달성하는 RAEv2를 제시한다.
Representation Autoencoder는 전통적인 VAE 대신 미리 학습된 시각 인코더의 표현을 확산 모델의 잠재 공간으로 쓴다. RAEv2는 인코더 마지막 층 하나가 아니라 마지막 여러 층의 합을 표현으로 사용해 별도 미세조정이나 특수 데이터 없이 재구성을 개선한다. 또한 RAE와 중간 확산 층에 표현을 맞추는 REPA가 서로 대체 관계가 아니라 보완 관계임을 대규모 실험으로 보였다. DiT 출력을 다시 매개변수화하면 REPA 신호를 추가 모델이 필요 없는 안내로도 활용할 수 있다. ImageNet-256에서 기존 RAE보다 열 배 넘게 빨리 수렴해 80에폭 만에 최고 수준의 생성 품질을 냈고, 텍스트 이미지 생성과 탐색 세계 모델에서도 개선을 확인했다.
핵심 요약
- 이 논문은 여러 설계 선택을 체계적으로 조사해 RAE를 단순화하고 개선하는 세 가지 통찰을 발견한다.
- 첫째, 표현을 최종 인코더 층 하나만이 아니라 마지막 k개 인코더 층의 합으로 정의하는 일반화된 정식화를 연구한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.