Mellum2 Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 279
- 분야
- LLMs / NLP
- arXiv 번호
- 2605.31268
Mellum2 기술 보고서다.
이 보고서는 토큰당 2.5B 활성 파라미터를 갖는 오픈웨이트 12B 파라미터 MoE 언어 모델 Mellum 2를 소개한다. Mellum 2는 소프트웨어 엔지니어링에 특화된 범용 언어 모델로, 코드 생성 및 편집, 디버깅, 다단계 추론, 도구 사용 및 함수 호출, 에이전트 코딩, 대화형 프로그래밍 지원을 아우르며, 완성에 초점을 둔 4B 밀집 모델 Mellum의 후속 모델이다. 구조는 MoE(64개 전문가, 8개 활성) 위에 구축되며, KV 헤드 4개를 갖는 Grouped-Query Attention, 매 4개 층 중 3개 층에 적용되는 Sliding Window Attention, 그리고 보조 사전학습 목표이자 추측 디코딩을 위한 내장 드래프트 모델 역할을 겸하는 단일 Multi-Token Prediction 헤드를 결합한다. 각 선택은 보급형 GPU에서의 추론 효율을 설계 제약으로 두고 어블레이션으로 검증되었다. 사전학습은 약 10.6조 토큰에 걸쳐 진행되며, 다양한 웹 데이터에서 선별된 코드 및 수학 콘텐츠로 혼합 비율을 점진적으로 전환하는 3단계 커리큘럼을 따르고, FP8 하이브리드 정밀도와 0까지 선형 감쇠하는 Warmup-Hold-Decay 스케줄 하에서 Muon으로 최적화된다. 사전학습된 베이스는 층 선택적 YaRN을 통해 128K 컨텍스트 윈도우로 확장된 뒤 2단계(지도 미세조정에 이은 RLVR)로 후속 학습되어, 직접 답하는 Instruct 모델과 최종 답 이전에 명시적 추론 흔적을 출력하는 Thinking 모델이라는 두 가지 변형이 공개된다. 코드 생성, 수학 및 추론, 도구 사용, 지식, 안전성 벤치마크 전반에서 Mellum 2는 4B-14B 범위의 오픈웨이트 베이스라인과 경쟁력을 보이면서도 2.5B 밀집 모델의 토큰당 연산량으로 동작한다. 저자들은 베이스, instruct, thinking 체크포인트를 그 배경이 되는 구조 결정, 데이터 파이프라인, 학습 레시피를 담은 이 보고서와 함께 Apache 2.0 라이선스로 공개한다.
핵심 요약
- 이 보고서는 토큰당 2.5B 활성 파라미터를 갖는 오픈웨이트 12B 파라미터 MoE 언어 모델 Mellum 2를 소개한다.
- 코드 생성, 수학 및 추론, 도구 사용, 지식, 안전성 벤치마크 전반에서 Mellum 2는 4B-14B 범위의 오픈웨이트 베이스라인과 경쟁력을 보이면서도 2.5B 밀집 모델의 토큰당 연산량으로 동작한다.
- 저자들은 베이스, instruct, thinking 체크포인트를 그 배경이 되는 구조 결정, 데이터 파이프라인, 학습 레시피를 담은 이 보고서와 함께 Apache 2.0 라이선스로 공개한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.