LiFT: Loop Flow Transformers

발행일
출처
arXiv
논문 번호
1168
분야
Machine Learning
arXiv 번호
2610.05538

이 논문은 작은 모델을 반복 실행(루프)해서 큰 모델을 이기는 이미지 생성 트랜스포머를 만들었다.

이 논문은 한마디로 하나의 작은 Diffusion Transformer를 여러 번 돌려서 큰 모델보다 나은 이미지를 만드는 기법이다. 각 루프마다 목표 지점을 다르게 줘서 순차적으로 답을 다듬게 했다. 학습한 깊이보다 훨씬 많이 돌려도 재학습 없이 성능이 계속 올라간다. 그 결과 파라미터 약 60%를 줄이고 추론 연산도 약 52% 아끼면서 FID를 3.34점 낮췄다.

핵심 요약

  • 모델 초기 예측에서 정답까지 직선 경로를 그리고, 각 루프가 그 경로의 지점별 목표를 학습하게 했다.
  • 학습한 루프 수보다 훨씬 많이 돌려도 성능이 계속 좋아져서, 추론 때 계산량을 자유롭게 늘릴 수 있다.
  • ImageNet 256x256에서 파라미터 약 60%를 줄이고 추론 연산 약 52%를 아끼면서 FID 3.34점을 낮췄다.
  • 테스트 시점에 계산을 더 쓸수록 좋아지는(test-time scaling) 흐름을 이미지 생성에 싼값으로 적용한 사례다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)