AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding
- 발행일
- 출처
- arXiv
- 논문 번호
- 767
- 분야
- LLMs / NLP
- arXiv 번호
- 2607.25852
작업 유형에 따라 MTP와 블록 디퓨전 드래프터를 특화해 1.98-2.40배 추론 가속을 달성한 스페큘레이티브 디코딩 프레임워크.
이 논문은 한마디로 LLM 추론을 빠르게 하는 스페큘레이티브 디코딩에서 '작업 유형별로 다른 드래프터를 쓰면 더 빠르다'는 것을 보인 연구다. 채팅은 짧은 예측이 효율적이고(MTP), 코드/수학은 긴 블록 예측이 유리하다(블록 디퓨전). AngelSpec은 두 방식을 각각 특화 학습시키고, DFly라는 개선된 블록 디퓨전 구조를 제안한다. Hy3-A21B에서 자기회귀 대비 1.98~2.40배 가속을 달성했다.
핵심 요약
- 실제 서비스 환경에서 작업 유형(채팅 vs 코드/수학)에 따라 최적의 드래프터가 다름을 실험적으로 입증했다.
- DFly: 하이브리드 타겟 조건화 백본 + 전임자 조건 자기회귀 헤드로 블록 디퓨전의 품질을 높였다.
- D-cut: 검증을 배치 수준 공유 자원으로 취급해, 부하에 따라 검증 깊이를 적응적으로 조절했다.
- Hy3-A21B에서 평균 수용 길이 약 30% 증가, 동시성 4~64에서 최고 처리량 달성했다.
- 자기회귀 대비 1.98~2.40배, DFlash 대비 10.5~11.8% 높은 처리량을 기록했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.