Gemma 4 Technical Report

발행일
출처
arXiv
논문 번호
570
분야
LLMs / NLP
arXiv 번호
2607.02770

Google DeepMind의 Gemma 4 모델 패밀리 기술 보고서. 2.3B~31B 파라미터 dense 및 MoE 아키텍처로 thinking mode, 멀티모달, long-context 효율성을 개선한다.

Gemma 4는 open-weight 네이티브 멀티모달 모델 패밀리로, dense(2.3B/4.5B/12B/31B)와 MoE(26B-A4B) 아키텍처를 제공한다. 12B 모델은 인코더 없이 raw 오디오·이미지 패치를 직접 처리하는 통합 아키텍처를 도입했다. thinking mode, p-RoPE 위치 인코딩, KV cache 공유로 global KV cache를 37.5% 절감했으며, Arena 기준 31B dense 모델이 리딩 open dense 모델이다.

핵심 요약

  • 2.3B~31B dense + 26B-A4B MoE로 구성, 전 모델에 thinking mode 탑재
  • 12B 모델: 비전/오디오 인코더 제거, raw 패치를 LLM 임베딩 공간에 직접 투영하는 encoder-free 아키텍처
  • KV cache 공유 + keys-as-values + p-RoPE로 global KV cache 37.5% 절감
  • QAT 양자화: 31B 모델 64GB→19.2GB, 오디오 인코더 390MB→87MB(78% 감소)
  • Arena Elo 1451(31B)로 리딩 dense open 모델, RULER 128k에서 96.4% 정확도

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)