AdaptiveEmbed: Sample-Adaptive Multi-Vector Representation for Multimodal Retrieval
- 발행일
- 출처
- arXiv
- 논문 번호
- 1021
- 분야
- Computer Vision
- arXiv 번호
- 2608.25412
검색 임베딩 개수를 샘플별로 다르게 배분하면, 평균 2개 벡터로 고정 3~40개짜리보다 검색이 잘된다는 논문.
이 논문은 한마디로 '모든 데이터에 같은 개수의 벡터를 주던 멀티벡터 검색을 샘플별 맞춤으로 바꿨다'. 멀티벡터 검색(하나의 데이터를 여러 임베딩으로 표현)은 표현력이 좋지만, 모든 샘플에 동일한 벡터 수를 쓰는 게 비효율이었다. 저자는 샘플마다 추가 벡터의 검색 효용을 계산해 필요한 만큼만 배분하는 AdaptiveEmbed를 제안했다. 이미지·영상·오디오 검색에서 평균 벡터 2.1개로 고정 3~40개 방식보다 좋은 성적을 냈다.
핵심 요약
- 샘플마다 최적 벡터 수가 1개부터 8개까지 제각각이라는 관츬으로 문제를 제기했다.
- 다중 그룹 대조 학습(MGCL)으로 후보 벡터를 만들고, 효용 정책 최적화(UPO)로 샘플별 벡터 수를 결정한다.
- COCO에서 평균 2.1 벡터로 8개 방향 중 6개에서 최고 성능을 냈고, 54.6만 개 갤러리 OpenImages 제로샷에서도 리드했다.
- 비디오·오디오 검색에서도 평균 1.9 벡터로 고정 예산 방식을 이겨 모달리티 무관함을 보였다.
- 오라클(정답 배분)은 비슷한 평균 예산에서 평균 61.0 mAP까지 가능해서, 적응 배분 자체의 잠재력이 크다고 본다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.