LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

발행일
출처
arXiv
논문 번호
248
분야
Computer Vision
arXiv 번호
2605.27365

LocateAnything은 Parallel Box Decoding(PBD)을 활용하는 비전-언어 모델을 소개하며, 전체 바운딩 박스나 점을 원자 단위로 예측함으로써 빠르고 고품질의 시각적 그라운딩 및 탐지를 가능하게 한다.

LocateAnything은 바운딩 박스 좌표를 토큰별로 순서대로 생성하는 대신 박스나 점을 하나의 원자적 단위로 병렬 예측하는 시각 그라운딩 모델이다. Parallel Box Decoding은 한 박스 안의 좌표 관계를 보존하면서 생성 단계를 줄이고, 필요에 따라 빠른 모드와 견고한 모드를 선택할 수 있게 한다. 연구진은 1억 3,800만 개가 넘는 학습 샘플로 구성된 LocateAnything-Data도 구축해 다양한 정밀 위치 찾기 과제를 학습했다. 여러 검출과 그라운딩 평가에서 높은 IoU의 위치 정확도를 개선하면서 경쟁 방법보다 최대 2.5배 빠른 디코딩을 보고했다. 다만 현재 학습은 주로 지도 미세조정에 의존하므로, 어려운 밀집 장면과 긴 꼬리 사례의 강건성을 높이기 위한 강화학습은 후속 과제로 남는다.

핵심 요약

  • NTP를 위한 인과적 어텐션에서 표준 토큰은 자신보다 앞서 나온 토큰만 볼 수 있다.
  • Fast 모드는 모든 것에 병렬 디코딩을 사용한다. 이는 가장 높은 처리량을 제공하지만, 매우 밀집하거나 복잡한 장면에서는 가끔 오류를 낼 수 있다.
  • Slow 모드는 표준 순차 NTP로 되돌아간다. 더 견고하고 정밀하지만 훨씬 느리다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)