WeMM-Embedding: WeChat Multi-Modal Embedding Technical Report
- 발행일
- 출처
- arXiv
- 논문 번호
- 1015
- 분야
- Computer Vision
- arXiv 번호
- 2608.24053
이 논문은 텍스트·이미지·영상·문서를 하나의 임베딩 공간에 담는 텐센트 위챗의 범용 멀티모달 임베딩 모델군(2B/4B/9B) 기술 보고서다.
이 논문은 한마디로 위챗이 텍스트·이미지·영상·시각 문서까지 하나의 벡터 공간에 담는 범용 임베딩 모델군을 만들어 공개 벤치마크 1위를 찍고 실제 서비스에 얹은 기술 보고서다. 2단계 학습(대규모 정렬 → 정제 데이터·세밀한 관련도 감독·크기 간 지식 증류)으로 학습했다. 9B 모델은 MMEB-v2에서 80.6점으로 전체 1위(오픈소스·상용 포함)를 기록했고, 2B만으로도 기존 최고 8B 오픈소스 모델을 앞질렀다. 위챗 추천·검색 14건의 온라인 A/B 테스트에서 성과 향상을 확인해 실제로 배치했다. 256차원으로 줄여도 전체 성능의 98.7%를 유지해 가볍게 쓸 수도 있다.
핵심 요약
- 텍스트·이미지·영상·문서·섞인 입력을 한 모델로 임베딩하고, 출력 차원도 64~2048까지 자유롭게 뽑을 수 있다.
- 9B 모델이 MMEB-v2 종합 80.6점으로 오픈소스·상용 모델 전체 1위를 기록했다(2026-08-24 기준).
- 2B 소형 모델만으로도 기존 최고 성능 8B 오픈소스 모델을 앞질러 효율성을 입증했다.
- 위챗 채널·공식계정·모멘트·커머스 검색·추천에 실배치되고 14건 A/B 테스트에서 일관된 향상을 냈다.
- 256차원으로 축소해도 2,048차원 대비 98.7% 성능을 유지해 저장·속도 부담을 크게 줄였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.