Nemotron 3 Super: Open, Efficient Mixture-of-Experts Hybrid Mamba-Transformer Model for Agentic Reasoning
- 발행일
- 출처
- arXiv
- 논문 번호
- 146
- 분야
- LLMs / Architecture
- arXiv 번호
- 2604.12374
NVIDIA의 Nemotron 3 Super는 하이브리드 Mamba-Attention Mixture-of-Experts 구조에 새로운 LatentMoE와 Multi-Token Prediction(MTP) 메커니즘을 결합한 모델이다.
NVIDIA의 Nemotron 3 Super는 하이브리드 Mamba-Attention Mixture-of-Experts 구조에 새로운 LatentMoE와 Multi-Token Prediction(MTP) 메커니즘을 결합한 모델이다. NVFP4를 사용해 25조 토큰으로 사전학습된 이 모델은 경쟁력 있는 정확도와 효율적인 양자화 배포를 유지하면서 최대 7.5배 높은 추론 처리량과 향상된 에이전트형 추론 능력을 달성한다.
핵심 요약
- 기존 대규모 언어 모델은 추론 효율성과 실제 배포 비용에서 어려움을 겪으며, 이전의 Mixture-of-Experts(MoE) 설계는 실세계의 지연 시간과 메모리 대역폭 제약을 간과하는 경우가 많았다.
- 대규모 언어 모델 사전학습을 수조 개의 토큰으로 확장하면서 저정밀도 포맷에서 안정성과 정확도를 유지하는 것은 미해결 문제이며, 에너지 효율성과 하드웨어 친화성을 저해한다.
- 다단계 도구 사용과 장기 과제를 아우르는 견고하고 일반화 가능한 에이전트형 추론 능력을 LLM에 개발하려면 특화된 구조적 접근과 학습적 접근이 필요하다.
- 효율적 라우팅을 위한 새로운 LatentMoE 설계와, 모델링 품질 및 추측적 디코딩을 개선하는 Multi-Token Prediction(MTP) 메커니즘을 갖춘 하이브리드 Mamba-Attention Mixture-of-Experts(MoE) 구조를 도입한다.
- NVIDIA 독자 저정밀도 포맷인 NVFP4를 사용해 25조 토큰으로 대규모 사전학습을 수행하며, 대규모 환경에서의 안정성과 정확도를 입증한다.
- 광범위한 지도 미세조정(SFT)과 검증 가능한 보상으로부터의 다중 환경 강화학습(RLVR)을 결합한 다단계 사후학습 파이프라인을 구현하며, 에이전트형 추론과 최대 1M 토큰의 장문맥 능력에 집중한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.