Large Language Diffusion Models

발행일
출처
arXiv
논문 번호
034
분야
LLMs / Diffusion
arXiv 번호
2502.09992

LLaDA는 처음부터 학습된 새로운 80억 파라미터 확산 모델을 도입해, 확산 모델이 대규모 언어 모델링에서 최첨단 자기회귀 모델과 경쟁할 만한 성능을 달성할 수 있음을 입증한다.

LLaDA는 처음부터 학습된 새로운 80억 파라미터 확산 모델을 도입해, 확산 모델이 대규모 언어 모델링에서 최첨단 자기회귀 모델과 경쟁할 만한 성능을 달성할 수 있음을 입증한다. 이 연구는 LLM 능력이 본질적으로 자기회귀 구조에 의존한다는 가정에 도전하며 역전의 저주에 대한 해법을 제공한다.

핵심 요약

  • 대규모 언어 모델의 능력(확장성, 문맥 내 학습)이 자기회귀 구조에만 있다는 것이 통념이다.
  • 양방향 또는 역방향 추론을 요하는 작업에서 모델이 어려움을 겪는 역전의 저주처럼 자기회귀 모델에는 한계가 있다.
  • 수십억 파라미터 규모의 자기회귀 모델과 성능 면에서 견줄 수 있는 대규모 언어 확산 모델이 없었다.
  • 인과 마스크 없이 Transformer 백본을 활용해 이산 토큰 시퀀스를 위한 마스크 확산 모델(MDM)인 LLaDA를 개발했다.
  • 음의 로그 가능도의 상한을 이루는 원칙적인 교차 엔트로피 손실을 최적화하며, 2.3조 토큰 데이터셋으로 80억 파라미터 LLaDA 모델을 처음부터 학습했다.
  • 생성 품질과 속도의 균형을 맞추는 저신뢰도 재마스킹 기법을 포함한 유연한 반복 샘플링 전략을 추론에 구현했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)