Unlocking Lossless Speedups in LLMs via Discrete Diffusion

발행일
출처
arXiv
논문 번호
1067
분야
Machine Learning
arXiv 번호
2609.04010

기존 LLM에 가벼운 확산 가중치만 얹어 토큰 여러 개를 동시에 뽑게 하여 최대 3배 가속하되, 답 품질은 수학적으로 그대로 보존하는(무손실) 방법을 제안한 논문이다.

이 논문은 한마디로 'Uno'라는 모델 구조로, 원래 모델의 답 분포는 그대로 두고 토큰을 동시에 여러 개 뽑는 확산 가중치만 추가해 LLM 추론을 최대 3배 가속한 연구다. 작은 초안 모델이 필요한 기존 추측 디코딩과 달리 한 모델 안에서 확산 가중치가 초안을 뽑고 원본 가중치가 검증한다. 검증이 엄격해서 답 분포가 원본과 정확히 같은 무손실 가속이고, 배치가 커져도 이득이 사라지지 않아 장비 최대 배치에서도 2배 빠름을 유지한다. 8B 모델이 26B 확산 LLM과 상용 Mercury 2를 도구 사용·코딩·긴 문서 과제 전부에서 앞섰다.

핵심 요약

  • 기존 LLM에 확산(여러 토큰을 동시에 채우는 방식) 가중치를 얹는 가벼운 학습 단계만 추가해, 구조를 크게 바꾸지 않고도 최대 3배 가속을 얻었다.
  • 초안 전용 작은 모델이 필요한 추측 디코딩(EAGLE-3, DFlash)과 달리 한 모델에서 초안+검증을 처리하고, 답 분포가 원본과 정확히 같은 무손실 가속이다.
  • 기존 확산 LLM은 배치가 커지면 이득이 사라졌는데, Uno는 평가한 모든 배치에서 추측 디코딩보다 처리량이 높고 최대 배치에서도 2배 빠름을 유지했다.
  • 8B Uno가 26B DiffusionGemma와 상용 Mercury 2를 에이전트 도구 사용·코딩·긴 문서 추론 전 벤치마크에서 이겼다.
  • RL 후속학습에서 가장 느린 롤아웃 생성 단계도 빨라져, 추론뿐 아니라 강화학습 훈련 자체를 가속할 수 있음을 보였다.
  • 이미 공개된 오픈웨이트 모델에 얹어 만들 수 있어서, 새로 대형 학습을 하지 않아도 된다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)