DSpark: Confidence-Scheduled Speculative Decoding with Semi-Autoregressive Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 575
- 분야
- AI / General
- arXiv 번호
- 2607.05147
DSpark는 반자기회귀 드래프트 생성과 부하 인식 검증 스케줄링을 결합하여 DeepSeek-V4 서빙에서 60-85% 속도 향상을 달성한 추론 디코딩 프레임워크다.
DSpark는 LLM 추론 가속을 위한 speculative decoding 프레임워크로, 병렬 백본과 경량 순차 모듈을 결합한 반자기회귀 아키텍처로 토큰 간 의존성을 모델링하여 접미부 감쇠를 완화한다. 또한 confidence head가 추정한 prefix 생존 확률과 실시간 엔진 부하를 기반으로 검증 길이를 동적으로 조정하는 스케줄링을 도입했다. DeepSeek-V4 실제 트래픽 환경에서 기존 MTP-1 대비 사용자당 생성 속도 60-85% 향상을 달성했다.
핵심 요약
- 반자기회귀 아키텍처: 병렬 백본 + 경량 RNN 헤드로 토큰 간 의존성 주입, per-token 확률은 정확한 softmax로 유지
- Confidence-scheduled verification: 위치별 prefix 생존 확률 추정 + 하드웨어 인식 스케줄러로 검증 길이 동적 조정
- Qwen3-4B/8B/14B에서 Eagle3 대비 accepted length 각각 30.9%, 26.7%, 30.0% 개선, DFlash 대비 16-18% 개선
- DeepSeek-V4-Flash 실제 트래픽에서 MTP-1 대비 사용자당 60-85% 속도 향상, V4-Pro에서 57-78% 향상
- 동시성이 높은 환경에서 검증 길이를 자동 축소하여 배치 용량 낭비 방지, Pareto frontier 확장
- DSpark 체크포인트와 DeepSpec 학습 저장소를 오픈소스로 공개
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.