FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders

발행일
출처
arXiv
논문 번호
1127
분야
Computer Vision
arXiv 번호
2609.31620

이 논문은 이미지 생성용 오토인코더(RAE)에서 '어느 층 특징을 쓸까'라는 선택지를 랜덤 학습으로 풀어, 재구성 품질과 생성 품질 사이 간극을 줄였다.

이 논문은 한마디로 사전학습된 비전 인코더의 특징을 재활용하는 이미지 생성기(표현 오토인코더, RAE)의 고민을 해결한 연구다. 얕은 층은 화소 디테일에, 깊은 층은 생성 품질에 유리해서 어느 층을 쓸지 고정하면 한쪽이 희생됐다. 저자들은 학습할 때마다 인코더 층의 임의 부분집합만 쓰도록 해서(FuseReg) 어떤 층 조합에도 견디는 디코더를 만들었다. 그 결과 디코더 하나가 전체/희소/단일 층 입력을 모두 처리하면서 전용 디코더보다 재구성 품질(PSNR)이 더 높았고, 생성 품질 지표(gFID)도 최대 29% 낮췼다.

핵심 요약

  • 층 선택을 사람이 정하는 대신, 학습 때마다 인코더 층을 무작위로 섞어 쓰는 규칙(FuseReg) 하나로 문제를 풀었다.
  • 이 규칙이 '층끼리 서로 다른 신호에 예민해지지 않게' 하는 벌점 역할을 한다는 걸 이론적으로도 보였다.
  • 디코더 하나가 전체/희소/단일 층 입력을 재학습 없이 다 처리하면서, 고정 방식 전용 디코더보다 재구성 품질(PSNR)이 더 높았다.
  • 디코더만 바꿔도 이미지 생성 품질(gFID)이 27% 좋아졌고, 생성 단계까지 같은 규칙을 함께 적용하면 29% 좋아졌다.
  • 사전학습 인코더는 전혀 손대지 않아서, 기존 모델 자산을 그대로 쓸 수 있다는 실용적 장점이 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)