Twins: Learn to Predict Unified Representations with Focal Loss

발행일
출처
arXiv
논문 번호
722
분야
Computer Vision
arXiv 번호
2607.22531

이미지 이해용(ViT)과 생성용(VAE) 특징을 이어 붙여서 하나의 토큰으로 통합한 'Twins' 표현 방식. focal loss로 학습 불균형을 해결했다.

이 논문은 한마디로 이미지 이해에 쓰이는 ViT 특징과 이미지 생성에 쓰이는 VAE 특징을 채널 방향으로 이어 붙여, 하나의 통합된 토큰(Twins)을 만드는 방법이다. 토큰 길이는 늘어나지 않아 계산 비용도 그대로다. 하지만 Diffusion Transformer로 학습하면 ViT는 잘 맞추고 VAE는 못 맞추는 불균형 문제가 생긴다. 이 논문은 그 원인을 주파수 특성, 고유 차원수, 조건 의존성의 차이로 분석하고, focal loss를 적용해 VAE 채널의 오차에 더 큰 가중치를 주어 균형을 맞췄다.

핵심 요약

  • ViT(의미)와 VAE(디테일) 특징을 채널 단위로 단순히 이어 붙여 통합 표현을 만들었다. 토큰 길이 불변.
  • DiT 학습 시 ViT는 잘 학습되지만 VAE는 학습이 안 되는 불균형을 발견하고, 3가지 원인(주파수, 차원수, 조건 의존성)을 규명했다.
  • Focal Loss를 flow matching에 적용해 VAE 채널 오차에 가중치를 주어 균형을 달성, ImageNet에서 MSE 대비 최대 10.57 gFID 개선.
  • 기존 단일 인코더(SigLIP2) 대비 이해 성능을 유지하면서 재구성 품질(PSNR)을 크게 높였다.
  • Classifier-free guidance와 함께 쓰면 FID 1.59 달성으로 준수한 생성 품질을 보인다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)