Describe Anything: Detailed Localized Image and Video Captioning
- 발행일
- 출처
- arXiv
- 논문 번호
- 063
- 분야
- Vision-Language
- arXiv 번호
- 2504.16072
NVIDIA와 UC Berkeley 연구진은 포컬 프롬프트 메커니즘과 국소화 비전 백본을 통해 이미지와 영상 내 특정 영역에 대한 상세 캡션을 생성하는 비전-언어 아키텍처 DAM(Describe Anything Model)을 소개한다. 준지도 학습 파이프라인으로 데이터 부족 문제를 해결하면서 7개 벤치마크에서 최첨단 성능을 달성한다.
NVIDIA와 UC Berkeley 연구진은 포컬 프롬프트 메커니즘과 국소화 비전 백본을 통해 이미지와 영상 내 특정 영역에 대한 상세 캡션을 생성하는 비전-언어 아키텍처 DAM(Describe Anything Model)을 소개한다. 준지도 학습 파이프라인으로 데이터 부족 문제를 해결하면서 7개 벤치마크에서 최첨단 성능을 달성한다.
핵심 요약
- 기존 비전-언어 모델은 이미지와 영상 내 특정 영역에 대해 상세하고 정확한 캡션을 생성하는 데 어려움을 겪는다.
- 상세한 국소 캡션 모델을 학습시키기 위한 고품질 데이터셋의 가용성이 제한적이다.
- 현재의 평가 지표는 종종 포괄적인 세부 정보가 부족한 참조 캡션에 의존한다.
- 다중 세분성 영역 캡션을 위해 포컬 프롬프트와 국소화 비전 백본을 갖춘 DAM 아키텍처를 개발했다.
- 분할 데이터셋과 레이블이 없는 웹 이미지를 활용하는 SSL 기반 데이터 파이프라인 DLC-SDP를 구축했다.
- 참조 캡션 없이 상세 국소 캡션을 평가하기 위한 DLC-Bench를 도입했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.