AdaptiveEmbed: Sample-Adaptive Multi-Vector Representation for Multimodal Retrieval

발행일
출처
arXiv
논문 번호
1021
분야
Computer Vision
arXiv 번호
2608.25412

검색 임베딩 개수를 샘플별로 다르게 배분하면, 평균 2개 벡터로 고정 3~40개짜리보다 검색이 잘된다는 논문.

이 논문은 한마디로 '모든 데이터에 같은 개수의 벡터를 주던 멀티벡터 검색을 샘플별 맞춤으로 바꿨다'. 멀티벡터 검색(하나의 데이터를 여러 임베딩으로 표현)은 표현력이 좋지만, 모든 샘플에 동일한 벡터 수를 쓰는 게 비효율이었다. 저자는 샘플마다 추가 벡터의 검색 효용을 계산해 필요한 만큼만 배분하는 AdaptiveEmbed를 제안했다. 이미지·영상·오디오 검색에서 평균 벡터 2.1개로 고정 3~40개 방식보다 좋은 성적을 냈다.

핵심 요약

  • 샘플마다 최적 벡터 수가 1개부터 8개까지 제각각이라는 관츬으로 문제를 제기했다.
  • 다중 그룹 대조 학습(MGCL)으로 후보 벡터를 만들고, 효용 정책 최적화(UPO)로 샘플별 벡터 수를 결정한다.
  • COCO에서 평균 2.1 벡터로 8개 방향 중 6개에서 최고 성능을 냈고, 54.6만 개 갤러리 OpenImages 제로샷에서도 리드했다.
  • 비디오·오디오 검색에서도 평균 1.9 벡터로 고정 예산 방식을 이겨 모달리티 무관함을 보였다.
  • 오라클(정답 배분)은 비슷한 평균 예산에서 평균 61.0 mAP까지 가능해서, 적응 배분 자체의 잠재력이 크다고 본다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)