An Open-Source Two-Stage Computer Vision Pipeline for Fine-Grained Vehicle Classification using Vision Transformers
- 발행일
- 출처
- arXiv
- 논문 번호
- 313
- 분야
- Computer Vision
- arXiv 번호
- 2606.05149
차량 차체 유형은 추월 사고에서 자전거 이용자의 부상 심각도를 좌우하는 중요한 요인이지만, 자연 주행 도로 영상으로부터 차량을 부상 위험 관련 범주로 분류하는 자동화 도구는 공개 문헌에 존재하지 않는다.
이 논문은 자전거 추월 영상에서 차량을 승용차, SUV, 픽업트럭, 미니밴, 대형 밴, 상용 트럭으로 나누는 공개 파이프라인을 제시한다. 먼저 사전 학습된 RT-DETR이 차량 위치를 찾고, 미세 조정한 ViT-Base/16이 차체 유형을 분류한다. 확신이 0.60보다 낮으면 억지로 분류하지 않고 '알 수 없음'으로 남겨 조용한 오분류를 줄인다. 앤아버의 3,805건에서는 정확도 0.94를, 다른 장소의 311건에서는 재학습 없이 0.89를 기록했으며 미니밴 성능 하락은 주로 오분류보다 기권 증가로 나타났다. 다만 고정형 자전거 도로 카메라에 맞춘 평가여서 교차로 상공 카메라나 차량·드론 영상 같은 다른 시점에는 별도 적응이 필요하다.
핵심 요약
- 미시간주 앤아버의 자전거 도로 구간에서 수집한 3,805건의 주석 달린 추월 이벤트(분포 내)로 평가한 결과, 이 파이프라인은 0.94의 정확도를 달성했으며 클래스별 F1 점수는 0.91(미니밴)부터 0.97(SUV)까지였다.
- 잘 대표된 네 범주 중 세 범주는 도메인 변화 하에서도 F1을 0.90 이상으로 유지했다.
- 추론 스크립트, 학습 코드, 평가 유틸리티, 모델 가중치를 포함한 전체 파이프라인은 도로변 영상 아카이브와 자전거 안전 연구 전반에서 재현성과 재사용을 지원하기 위해 오픈소스 소프트웨어로 공개된다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.