Mach-Mind-4-Flash Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 594
- 분야
- Machine Learning
- arXiv 번호
- 2607.09375
35B MoE(3B 활성) 파라미터로 100B급 모델에 필적하는 성능을 달성한 agentic 모델의 포스트트레이닝 기술 보고서이다.
Mach-Mind-4-Flash는 35B MoE(3B 활성) 모델을 대상으로 포스트트레이닝만으로 100B+급 성능에 도달한 사례다. 핵심은 세 단계 파이프라인이다: (1) 통합 RL/OPD 훈련 인프라와 연산자 수준 가속으로 17% 속도 향상, (2) Reasoning/General/Agent 트랙별 전문가를 독립 학습 후 MOPD(Multi-Teacher On-Policy Distillation)로 융합, (3) HMPO로 추론 사슬을 19~46% 압축. AIME'26 92.70, IFBench 82.82, Behavioral-SafetyBench 80.74 등 다양한 벤치마크에서 10~30배 큰 모델과 경쟁한다.
핵심 요약
- 35B MoE(3B 활성) 모델이 포스트트레이닝만으로 100B+급 성능 달성 — 사전학습 컴퓨트 확장 없이
- MOPD(Multi-Teacher On-Policy Distillation): 도메인별 RL 전문가를 독립 학습 후 routed reverse-KL로 융합, 혼합 보상 RL의 시소 현상 제거
- HMPO: 단일 단계 토큰 효율 최적화로 추론 사슬 19~46% 압축, 정확도 손실 0.7pp 이하
- AIME'26 92.70, BFCL-v4 75.80, ClawBench 84.20 — 3B 활성 파라미터로 1T급 모델과 경쟁
- SonicMoE GEMM 커널 + 세그먼트 공유 전문가 융합으로 17% end-to-end 훈련 가속
- 토큰 효율성에서도 Pareto frontier를 재구성 — 유사 정확도에 토큰 사용량 대폭 절감
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.