Improved Large Language Diffusion Models

발행일
출처
arXiv
논문 번호
501
분야
LLMs / NLP
arXiv 번호
2606.25331

완전 bidirectional attention의 masked diffusion 언어모델 iLLaDA(8B)를 12T 토큰으로 사전학습. 비자기회귀 모델이 자기회귀 모델(Qwen2.5 7B)과 여러 벤치마크에서 경쟁력을 보인다.

iLLaDA는 LLaDA를 개선한 8B fully bidirectional masked diffusion 언어모델로, 12T 토큰 사전학습과 25B 토큰 SFT(12 epoch)를 수행했다. grouped-query attention, tied embedding, 학습률 스케줄 개선, confidence-based scoring 등을 도입했다. BBH에서 21.6점, ARC-Challenge에서 14.9점 향상되었으며, MATH에서 14.5점, HumanEval에서 16.5점 개선되었다. Qwen2.5 7B Base와 평균에서 동등한 성능을 보였다.

핵심 요약

  • masked diffusion 언어모델을 12T 토큰까지 스케일업한 최초의 사례로, 8B 파라미터로 from-scratch 학습했다.
  • grouped-query attention 도입으로 KV-cache 메모리를 줄이고 tied embedding으로 파라미터를 7.62B로 경량화했다.
  • confidence-based scoring으로 다지선다 평가에서 likelihood 방식 대비 PIQA +1.3, ARC-C +0.6, HellaSwag +2.3 향상했다.
  • SFT를 12 epoch까지 진행할수록 GSM8K, MATH, MMLU-Pro가 지속적 향상되어 diffusion LLM에서 data-reuse 효과를 확인했다.
  • Base 모델 기준 MMLU 74.8, BBH 71.3, GSM8K 81.9로 Qwen2.5 7B(71.9/63.9/78.9)를 여러 벤치마크에서 능가했다.
  • Instruct 모델은 RL 정렬이 없어도 MMLU-Redux 76.4, GSM8K 89.0으로 경쟁적이나, code/math에서는 여전히 Qwen2.5 Instruct에 뒤진다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)