Looped Diffusion Transformer
- 발행일
- 출처
- arXiv
- 논문 번호
- 1141
- 분야
- Computer Vision
- arXiv 번호
- 2609.40305
이 논문은 이미지 생성 모델을 키우지 않고도 같은 블록을 여러 번 반복 실행(루프)해서 성능을 올리는 방법을 제안했다.
이 논문은 한마디로 '모델을 키우는 대신 같은 계산을 여러 번 돌려서(루프)' 텍스트→이미지 생성 품질을 끌어올린 연구다. 저자들은 루프를 단순히 반복하면 품질이 오히려 망가지는 원인을 중간 단계 감독 부족과 어텐션(데이터에서 중요한 부분에 집중하는 기법) 업데이트 불안정으로 찾았다. 그래서 중간 루프마다 학습 신호를 주고, 어텐션을 스스로 조절하게 만든 'Looped-DiT'를 제안했다. 그 결과 파라미터 2억6천만짜리 모델이 6.5배 큰 모델을 이기면서도 추론 계산은 4.9배 적게 썼고, 루프가 깊어질수록 앞서 저지른 실수를 점점 고치는 '은근한 추론' 같은 행동도 보였다.
핵심 요약
- 모델 크기를 키우는 대신 같은 트랜스포머 블록을 한 번의 노이즈 제거 안에서 여러 번 돌리는(루프) 방식으로 확장성을 얻었다.
- 단순 반복은 품질이 나빠지는데, 그 원인이 중간 루프의 약한 감독과 어텐션 업데이트 불안정이라는 걸 찾아냈다.
- 중간 루프 감독 + 자기조절 어텐션을 합친 Looped-DiT로 파라미터 2억6천만 모델이 6.5배 큰 모델을 능가했다.
- 같은 추론 예산에서는 노이즈 제거 단계를 늘리는 것보다 루프 깊이를 늘리는 게 더 효과가 컸다.
- 깊은 루프가 앞 루프의 실수를 점진적으로 교정하는, 잠재적 추론(latent reasoning)을 시사하는 행동을 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.