TuringViT: Making SOTA Vision Transformers Accessible to All
- 발행일
- 출처
- arXiv
- 논문 번호
- 494
- 분야
- Computer Vision
- arXiv 번호
- 2606.24253
TuringViT는 고해상도와 다이내믹 해상도를 효율적으로 처리하고 10%의 데이터로도 오픈소스 ViT 베이스라인을 능가하는 VLM 네이티브 비전 트랜스포머이다.
TuringViT는 튜링 선형 어텐션(TLA)을 도입하여 고해상도와 다이내믹 해상도 비주얼 시퀀스를 효율적으로 처리한다. VISTA-Curation 파이프라인으로 이미지-비디오 데이터를 큐레이션하여 데이터 효율성을 높이고 네이티브 다이내믹 해상도 학습을 지원한다. TuringViT는 제로샷 분류 평균 83.6점, 검색 평균 78.9점을 달성하고 다운스트림 VLM 성능을 향상시킨다.
핵심 요약
- TuringViT는 튜링 선형 어텐션(TLA)을 도입하여 고해상도와 다이내믹 해상도 비주얼 시퀀스를 효율적으로 처리한다
- VISTA-Curation 파이프라인으로 이미지-비디오 데이터를 큐레이션하여 데이터 효율성을 높이고 네이티브 다이내믹 해상도 학습을 지원한다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.