ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

발행일
출처
arXiv
논문 번호
778
분야
Computer Vision
arXiv 번호
2607.28627

VLM에서 학습 가능한 단일 토큰으로 관련 시각 정보를 검색하는 경량 방법. 이미지→비디오 제로샷 전이.

이 논문은 한마디로 비전-언어 모델에 학습 가능한 토큰 하나를 추가해서, 긴 비디오나 많은 이미지 중 질문과 관련된 부분만 찾아내게 한다는 이야기다. 기존 VLM의 어텐션 점수로는 관련 프레임을 찾기 어렵다는 문제를 발견하고, '값 공간'에서 검색하면 훨씬 정확하다는 통찰을 제시했다. Visual Haystacks에서 Qwen3VL-8B에 +13.4점, LVBench에서 제로샷 +8.0점 향상을 달성했다. 학습과 추론이 H100 한 장에서 가능하다.

핵심 요약

  • VLM의 어텐션(쿼리-키) 점수는 시각 정보 검색에 부적합함을 발견했다. 평균 recall@1 단 5.1%.
  • 학습 가능한 단일 토큰(ReToken)을 추가하여 '값 공간'에서 관련 프레임을 명시적으로 검색한다.
  • Visual Haystacks에서 Qwen3VL-8B +13.4점, InternVL3.5 +12.4점 (상대적 20% 이상 향상).
  • 이미지 QA로만 학습했어도 긴 비디오에 제로샷 전이되어 LVBench +8.0점 향상.
  • H100 1장으로 학습+추론 가능한 경량 설계. 검색 단계 추가 지연은 약 0.4초.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)