Large Language Diffusion Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 034
- 분야
- LLMs / Diffusion
- arXiv 번호
- 2502.09992
LLaDA는 처음부터 학습된 새로운 80억 파라미터 확산 모델을 도입해, 확산 모델이 대규모 언어 모델링에서 최첨단 자기회귀 모델과 경쟁할 만한 성능을 달성할 수 있음을 입증한다.
LLaDA는 처음부터 학습된 새로운 80억 파라미터 확산 모델을 도입해, 확산 모델이 대규모 언어 모델링에서 최첨단 자기회귀 모델과 경쟁할 만한 성능을 달성할 수 있음을 입증한다. 이 연구는 LLM 능력이 본질적으로 자기회귀 구조에 의존한다는 가정에 도전하며 역전의 저주에 대한 해법을 제공한다.
핵심 요약
- 대규모 언어 모델의 능력(확장성, 문맥 내 학습)이 자기회귀 구조에만 있다는 것이 통념이다.
- 양방향 또는 역방향 추론을 요하는 작업에서 모델이 어려움을 겪는 역전의 저주처럼 자기회귀 모델에는 한계가 있다.
- 수십억 파라미터 규모의 자기회귀 모델과 성능 면에서 견줄 수 있는 대규모 언어 확산 모델이 없었다.
- 인과 마스크 없이 Transformer 백본을 활용해 이산 토큰 시퀀스를 위한 마스크 확산 모델(MDM)인 LLaDA를 개발했다.
- 음의 로그 가능도의 상한을 이루는 원칙적인 교차 엔트로피 손실을 최적화하며, 2.3조 토큰 데이터셋으로 80억 파라미터 LLaDA 모델을 처음부터 학습했다.
- 생성 품질과 속도의 균형을 맞추는 저신뢰도 재마스킹 기법을 포함한 유연한 반복 샘플링 전략을 추론에 구현했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.