Abra: Scaling Diffusion Image Training

발행일
출처
arXiv
논문 번호
945
분야
Machine Learning
arXiv 번호
2608.17286

텍스트-이미지 확산 모델의 컴퓨트 최적 스케일링 법칙을 정립해 파라미터당 이미지 토큰 200개라는 친칠라의 10배 규칙을 제시한 연구다.

이 논문은 한마디로 이미지 생성 확산 모델도 언어모델처럼 예측 가능한 스케일링 법칙을 따르지만 최적 데이터량은 10배 많아야 한다는 분석이다. 60M에서 2B 파라미터 모델군을 세 자릿수 컴퓨트 구간에서 학습해 얻은 결론이다. 컴퓨트 최적점은 파라미터당 약 200개 이미지 토큰이며 과잉 학습에 성능이 크게 무너지지 않아 작은 모델에 데이터를 더 쓰는 쪽이 안전하다고 권한다. 해상도가 높아지면 최적 토큰량이 더 늘고 학습 곡선이 보편적 형태로 수렴하는 스케일링 붕괴도 확산 모델에서 처음 확인했다.

핵심 요약

  • 10의 19승에서 22승 FLOPs 구간의 통제된 모델군으로 텍스트-이미지 확산 모델의 컴퓨트 최적 점을 측정했다.
  • 최적점은 파라미터당 약 200 이미지 토큰으로 언어모델 친칠라 규칙(20토큰)의 10배다.
  • 확산 모델은 과잉 학습에 강해서 예산이 남으면 모델을 키우기보다 데이터를 더 쓰는 쪽이 낫다.
  • FID와 CLIPScore 같은 생성 품질 지표, 표현 품질, 최적 CFG 설정도 컴퓨트에 따라 예측 가능하게 변한다.
  • 해상도가 오를수록 최적 토큰 수가 늘어서 고해상도 학습은 데이터 병목이 아니라 컴퓨트 병목이다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)