Looped Diffusion Language Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 245
- 분야
- Machine Learning
- arXiv 번호
- 2605.26106
KAIST, KRAFTON, UC Berkeley의 연구진은 선택적 루핑을 마스킹 확산 모델에 통합한 구조인 LoopMDM을 소개했다.
LoopMDM은 마스킹 확산 언어 모델의 초중반 레이어 일부를 같은 가중치로 반복 실행하는 구조다. 반복 블록은 매개변수를 늘리지 않고 유효 깊이를 키우며, 학습할 때 반복 횟수를 바꿔 다양한 계산량에 적응하도록 한다. 여러 사전학습 말뭉치에서 같은 크기의 기준 모델과 비슷한 성능을 최대 3.3배 적은 학습 연산량으로 달성했고, GSM8K에서는 최대 8.5점의 향상을 보고했다. 추론할 때 반복 횟수를 늘리거나 확산 단계에 맞춰 조절하면 계산량과 성능 사이의 선택도 가능하다. 다만 실험은 주로 중간 규모 모델과 사람이 정한 반복 위치 및 중지 규칙에 한정되어, 대규모 모델과 긴 문맥에서의 효과는 아직 검증 과제다.
핵심 요약
- Head는 순전파 시작 시 한 번 실행되는 일정 수의 레이어로 구성된다. 주된 역할은 초기 입력 임베딩을 처리하고 네트워크의 나머지 부분에 시작 표현을 제공하는 것이다.
- Tail은 Mid-block이 반복을 마친 후 한 번 실행되는 일정 수의 레이어로 구성된다. 이 레이어들은 표현을 최종화하고 이를 어휘 공간으로 투영하여 토큰 확률을 예측한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.