Abra: Scaling Diffusion Image Training
- 발행일
- 출처
- arXiv
- 논문 번호
- 945
- 분야
- Machine Learning
- arXiv 번호
- 2608.17286
텍스트-이미지 확산 모델의 컴퓨트 최적 스케일링 법칙을 정립해 파라미터당 이미지 토큰 200개라는 친칠라의 10배 규칙을 제시한 연구다.
이 논문은 한마디로 이미지 생성 확산 모델도 언어모델처럼 예측 가능한 스케일링 법칙을 따르지만 최적 데이터량은 10배 많아야 한다는 분석이다. 60M에서 2B 파라미터 모델군을 세 자릿수 컴퓨트 구간에서 학습해 얻은 결론이다. 컴퓨트 최적점은 파라미터당 약 200개 이미지 토큰이며 과잉 학습에 성능이 크게 무너지지 않아 작은 모델에 데이터를 더 쓰는 쪽이 안전하다고 권한다. 해상도가 높아지면 최적 토큰량이 더 늘고 학습 곡선이 보편적 형태로 수렴하는 스케일링 붕괴도 확산 모델에서 처음 확인했다.
핵심 요약
- 10의 19승에서 22승 FLOPs 구간의 통제된 모델군으로 텍스트-이미지 확산 모델의 컴퓨트 최적 점을 측정했다.
- 최적점은 파라미터당 약 200 이미지 토큰으로 언어모델 친칠라 규칙(20토큰)의 10배다.
- 확산 모델은 과잉 학습에 강해서 예산이 남으면 모델을 키우기보다 데이터를 더 쓰는 쪽이 낫다.
- FID와 CLIPScore 같은 생성 품질 지표, 표현 품질, 최적 CFG 설정도 컴퓨트에 따라 예측 가능하게 변한다.
- 해상도가 오를수록 최적 토큰 수가 늘어서 고해상도 학습은 데이터 병목이 아니라 컴퓨트 병목이다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.