UEmbed: Unified Sparse and Dense Multimodal Embeddings
- 발행일
- 출처
- arXiv
- 논문 번호
- 801
- 분야
- Computer Vision
- arXiv 번호
- 2608.02583
디코더 전용 멀티모달 대형언어모델 하나에 학습 가능한 특수 토큰 16개를 붙여, 한 번의 인과 순전파로 희소 어휘 벡터와 밀집 벡터를 동시에 뽑는 임베딩 모델 UEmbed을 제안했다. 공개 데이터만으로 학습해 MMEB-v2에서 밀집 71.8, 희소 71.0을 기록했다.
학습형 희소검색(LSR)은 지금까지 BERT 같은 양방향 인코더에 묶여 있었고, 멀티모달로 넘어가려면 별도의 교차모달 보조 모듈이 필요했다. 저자들은 디코더 전용 멀티모달 LLM 뒤에 학습 가능한 특수 토큰 N개를 붙이고, 어휘를 k-means(비슷한 것끼리 묶는 군집화 방법)로 N개의 겹치지 않는 부분집합으로 나눠, 각 특수 토큰이 자기 몫의 어휘에 대한 가중치를 예측하게 했다. 이렇게 하면 단일 토큰 하나로 거대한 어휘 공간을 표현해야 하는 정보 병목을 피할 수 있고, 밀집 벡터는 특수 토큰 앞의 EOS(입력이 끝났음을 알리는 토큰) 은닉상태에서 그대로 얻는다. 2B, 4B, 9B 세 규모로 공개했고 UEmbed-9B는 MMEB-v2에서 밀집 71.8, 희소 71.0으로 두 방식의 차이를 1점 이내로 좁혔다. BEIR 9개 데이터셋에서도 SPLADE-v3 같은 강한 기준선과 경쟁력을 유지했고, 에이전트 검색 벤치마크에서는 희소 모드가 검색 호출 횟수를 줄였다.
핵심 요약
- 특수 토큰을 16개 붙이고 어휘를 k-means로 16등분해 각 토큰이 한 덩어리씩 맡게 했다. 특수 토큰 개수 N을 2, 4, 8, 16, 32로 훑어보니 16까지는 성능이 안정적이고 32에서 뚜렷하게 떨어졌다.
- 어휘를 먼저 압축했다. 악센트 제거, 소문자화, 공백 정리로 같은 형태가 되는 토큰을 하나로 합쳐 어휘 크기를 248,320에서 184,016으로 줄였고, 점수를 매길 때는 합쳐진 것들 중 최대 가중치를 쓴다.
- UEmbed-9B는 MMEB-v2에서 밀집 71.8, 희소 71.0을 기록했다. 공개 데이터로 학습한 모델 중 밀집검색 1위이며 희소검색에서는 새로운 최고 성능이라고 주장한다.
- UEmbed-2B 기준으로 밀집과 희소 점수를 합친 혼합 점수를 쓰면 텍스트가 53.6에서 53.9로, 시각문서가 77.0에서 77.5로 올랐다. 반면 자연 이미지와 비디오는 표면 어휘 정보가 적어서 이득이 거의 없었다.
- 에이전트 검색 벤치마크 BrowseComp-Plus에서 희소 모드가 검색 라운드를 줄였다. UEmbed-2B는 밀집 39.19회에서 희소 32.67회로 줄면서 재현율은 53.47에서 57.04로 오히려 올랐고, 9B는 정확도 49.76으로 같은데 라운드가 33.68에서 31.05로 줄었다.
- 한계도 솔직히 적었다. 어휘가 큰 현대 LLM 특성상 '_alt' 같은 이상한 토큰이 활성화되기도 하고, 학습 말뭉치가 영어와 중국어에 치우쳐서 다른 언어 토큰은 잘 안 뜬다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.