dRAE: Representation Autoencoder with Hyper-Spherical Codes

발행일
출처
arXiv
논문 번호
726
분야
Computer Vision
arXiv 번호
2607.22148

고차원 시각 특징을 이산 코드로 변환할 때 발생하는 '코드북 붕괴' 문제를 각도 기반 라우팅으로 해결한 양자화 방법이다.

이 논문은 한마디로 고차원 시각 특징을 이산 토큰(코드)으로 변환할 때 일어나는 '코드북 붕괴(소수 코드만 쓰이는 현상)'를 해결한 새로운 양자화 방법 dRAE다. 원인을 유클리드 거리 기반의 코드 할당이 고차원 공간의 기하학과 맞지 않아서라고 진단했다. 해결책은 각도(방향) 기반으로 코드를 할당하는 Hyper-Spherical Quantization(HSQ)이다. 의미(방향)와 크기(magnitude)를 분리해서, 코드 할당은 의미로 하고 재구성은 크기 정보를 활용한다. 코드북을 13만 개까지 늘려도 100% 활용률을 유지하며 기존 VQ 대비 압도적 성능을 보였다.

핵심 요약

  • VQ의 코드북 붕괴 원인을 '유클리드 거리와 고차원 표현 공간의 기하학적 불일치'로 명확히 진단했다.
  • 각도(코사인 유사도) 기반 코드 할당 + 유클리드 commitment loss의 조합이 최적으로, 전부 각도로 하면 성능이 떨어진다.
  • 코드북을 131,072개까지 스케일업해도 100% 활용률을 유지하며, VQ·IBQ 대비 빠른 수렴과 안정적 학습을 보였다.
  • ImageNet 클래스 조건부 생성에서 gFID 4.45 (HSQ 65536)로 VQ 대비 큰 폭 개선, Text-to-Image에서도 준수한 성능.
  • 12M 이미지-텍스트 쌍만으로 GenEval 0.63, DPG-Bench 80.58로 효율적인 생성 파이프라인을 보여주었다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)