AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning
- 발행일
- 출처
- arXiv
- 논문 번호
- 586
- 분야
- Computer Vision
- arXiv 번호
- 2607.07033
비전-언어 모델에서 핵심 질의 증거를 먼저 보호한 후 문맥을 확장하는 training-free 비주얼 토큰 가지치기 프레임워크. 2,880개 중 160개만으로 97.6% 성능 유지.
AnchorPrune은 비전-언어 모델의 추론 비용을 줄이기 위해, 쿼리와 직접 관련된 핵심 증거를 '릴레반스 앵커'로 보호하고 그 위에 중요도 가중 새로움으로 보완적 문맥을 추가하는 training-free 가지치기 방법이다. 기존 관련성-다양성 통합 방식이 극단 압축에서 핵심 증거를 놓치거나 파편화하는 문제를 순차적 설계로 해결한다. CLIP 정렬/비정렬 및 이미지/비디오 VLM 모두에 적용 가능하며, LLaVA-NeXT-7B에서 2,880개 토큰 중 160개만으로 full-token 성능의 97.6%를 유지했다.
핵심 요약
- 릴레반스 앵커 구성 후 문맥 확장이라는 순차적 설계로 비대체적 쿼리 증거를 우선 보호
- 토큰의 novelty 프로파일에서 앵커 크기를 자동 적응 결정 (고정 비율 할당 아님)
- CLIP 정렬/비정렬, 이미지/비디오 VLM 모두에 적용 가능한 아키텍처 인식 설계
- LLaVA-NeXT-7B에서 160/2,880 토큰(5.6%)만으로 full 성능의 97.6% 유지
- 극단 압축(32 토큰)에서 기존 relevance-diversity 통합 방식 대비 3.7~5.7%p 높은 성능
- 훈련 불필요, 아키텍처 수정 없이 기존 VLM에 바로 적용 가능한 경량 프레임워크
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.