Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

발행일
출처
arXiv
논문 번호
243
분야
Computer Vision
arXiv 번호
2605.27295

Gemini Embedding 2는 비디오·오디오·이미지·텍스트를 단일 표현 공간에 임베딩하는 네이티브 멀티모달 모델로, 다양한 검색·추천·RAG 작업에서 SOTA를 달성한다.

Gemini Embedding 2는 Gemini의 멀티모달 능력을 기반으로 텍스트·이미지·비디오·오디오 및 그 교차 입력을 단일 벡터 공간에 매핑하는 네이티브 멀티모달 임베딩 모델이다. 대규모 contrastive learning과 다단계 멀티태스크 훈련으로 unimodal·cross-modal·멀티모달 검색 전반에서 SOTA를 달성했다. MSCOCO 62.9 R@1, MTEB 다국어 69.9, MTEB Code 84.0 등을 기록했으며, 천문학·생명과학·미술 등 전문 도메인에서도 강력한 zero-shot 성능을 보여준다.

핵심 요약

  • Gemini 기반 native multimodal 처리: 텍스트·이미지·비디오·오디오 및 interleaved 조합을 단일 임베딩 공간으로
  • 최대 3,072차원 벡터, 대규모 multi-task multi-stage contrastive learning으로 훈련
  • MSCOCO 62.9 R@1, Vatex 68.8 NDCG@10, MTEB 다국어 69.9, MTEB Code 84.0로 SOTA 달성
  • 기존 late-fusion 모델(CLIP, SigLIP) 대비 deep modal fusion으로 교차 모달리티 시너지 확보
  • 천문학·생물학·미술·요리 등 전문 영역에서 강력한 zero-shot 일반화 능력
  • RAG, 추천, 검색 등 실용 downstream에 즉시 활용 가능한 out-of-the-box 성능

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)