TuringViT: Making SOTA Vision Transformers Accessible to All

발행일
출처
arXiv
논문 번호
494
분야
Computer Vision
arXiv 번호
2606.24253

TuringViT는 고해상도와 다이내믹 해상도를 효율적으로 처리하고 10%의 데이터로도 오픈소스 ViT 베이스라인을 능가하는 VLM 네이티브 비전 트랜스포머이다.

TuringViT는 튜링 선형 어텐션(TLA)을 도입하여 고해상도와 다이내믹 해상도 비주얼 시퀀스를 효율적으로 처리한다. VISTA-Curation 파이프라인으로 이미지-비디오 데이터를 큐레이션하여 데이터 효율성을 높이고 네이티브 다이내믹 해상도 학습을 지원한다. TuringViT는 제로샷 분류 평균 83.6점, 검색 평균 78.9점을 달성하고 다운스트림 VLM 성능을 향상시킨다.

핵심 요약

  • TuringViT는 튜링 선형 어텐션(TLA)을 도입하여 고해상도와 다이내믹 해상도 비주얼 시퀀스를 효율적으로 처리한다
  • VISTA-Curation 파이프라인으로 이미지-비디오 데이터를 큐레이션하여 데이터 효율성을 높이고 네이티브 다이내믹 해상도 학습을 지원한다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)