Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing

발행일
출처
arXiv
논문 번호
682
분야
Computer Vision
arXiv 번호
2607.19064

4B(40억) 파라미터의 가벼운 이미지 생성/편집 모델로, A100 한 장에서 1초 이내 고해상도 이미지를 만들어내는 효율형 파운데이션 모델.

이 논문은 한마디로 4B 규모의 컴팩트한 이미지 생성+편집 스택을 만들어, 기존 수십B 모델들과 비슷한 품질을 훨씬 적은 비용으로 달성한 연구다. 핵심은 가벼운 토크나이저(Mage-VAE)와 원해상도(native-resolution) 확산 트랜스포머를 함께 설계한 것이다. Mage-VAE는 기존 VAE 대비 인코딩/디코딩 비용을 12~22배 줄이면서도 복원 품질은 유지한다. 여기에 CUDA 커널 융합으로 학습 속도를 2.5배 올렸고, 4단계 Turbo 변형으로 A100 한 장에서 1024x1024 이미지를 0.59초에 생성한다.

핵심 요약

  • 4B 파라미터로 경쟁 모델들(6B~80B)과 비슷한 성능을 내면서 메모리는 18GB 수준으로 낮췄다.
  • Mage-VAE 토크나이저가 기존 VAE 대비 픽셀당 연산량을 12~22배 줄였다.
  • CUDA 커널 융합으로 학습 처리량을 약 2.5배 향상했다.
  • Turbo 변형은 A100 1장에서 1024x1024 이미지를 0.59초, 편집을 1.02초에 수행한다.
  • 비용 효율성 때문에 연구자가 실험하고 수정하기 좋은 오픈 베이스라인 역할을 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)