Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
- 발행일
- 출처
- arXiv
- 논문 번호
- 243
- 분야
- Computer Vision
- arXiv 번호
- 2605.27295
Gemini Embedding 2는 비디오·오디오·이미지·텍스트를 단일 표현 공간에 임베딩하는 네이티브 멀티모달 모델로, 다양한 검색·추천·RAG 작업에서 SOTA를 달성한다.
Gemini Embedding 2는 Gemini의 멀티모달 능력을 기반으로 텍스트·이미지·비디오·오디오 및 그 교차 입력을 단일 벡터 공간에 매핑하는 네이티브 멀티모달 임베딩 모델이다. 대규모 contrastive learning과 다단계 멀티태스크 훈련으로 unimodal·cross-modal·멀티모달 검색 전반에서 SOTA를 달성했다. MSCOCO 62.9 R@1, MTEB 다국어 69.9, MTEB Code 84.0 등을 기록했으며, 천문학·생명과학·미술 등 전문 도메인에서도 강력한 zero-shot 성능을 보여준다.
핵심 요약
- Gemini 기반 native multimodal 처리: 텍스트·이미지·비디오·오디오 및 interleaved 조합을 단일 임베딩 공간으로
- 최대 3,072차원 벡터, 대규모 multi-task multi-stage contrastive learning으로 훈련
- MSCOCO 62.9 R@1, Vatex 68.8 NDCG@10, MTEB 다국어 69.9, MTEB Code 84.0로 SOTA 달성
- 기존 late-fusion 모델(CLIP, SigLIP) 대비 deep modal fusion으로 교차 모달리티 시너지 확보
- 천문학·생물학·미술·요리 등 전문 영역에서 강력한 zero-shot 일반화 능력
- RAG, 추천, 검색 등 실용 downstream에 즉시 활용 가능한 out-of-the-box 성능
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.