InstructSAM: Segment Any Instance with Any Instructions
- 발행일
- 출처
- arXiv
- 논문 번호
- 249
- 분야
- Computer Vision
- arXiv 번호
- 2605.26102
InstructSAM은 복잡한 자연어 지시에 따라 다중 인스턴스 분할을 수행하는 종단간 프레임워크를 제공하며, 명시적인 쿼리 기반 메커니즘을 통해 VLM과 SAM3를 통합한다.
InstructSAM은 자유 형식 지시를 만족하는 여러 객체를 한 번에 분할하기 위한 통합 프레임워크다. 비전-언어 모델 안에 학습 가능한 인스턴스 질의 묶음을 넣고, 각 질의가 서로 다른 대상의 슬롯으로 작동하도록 지시와 시각 정보를 결합한다. 혼합 어텐션으로 슬롯 사이 중복을 줄인 뒤 이 질의를 SAM3의 검출 질의 공간에 투영해 한 번의 순전파로 여러 마스크를 만든다. 연구진은 자유 형식 지시와 인스턴스 마스크를 연결한 Inst2Seg 데이터셋과 평가 기준도 구축했다. 2B 규모 모델의 실험은 복잡한 지시 및 구문 기반 분할에서 기존 종단간 방법과 여러 단계의 SAM3 에이전트 파이프라인보다 강한 결과를 보여준다.
핵심 요약
- 디코딩 단계에서는 마지막으로 스코어 헤드가 쿼리가 유효한 대상 인스턴스에 해당하는지 판단하고, 분할 헤드가 이진 마스크를 생성한다.
- 단일 대상의 경우 지시에서 언급된 하나의 특정 객체를 식별한다.
- 다중 대상의 경우 복잡한 조건을 만족하는 모든 인스턴스를 찾는다(예: '모든 나무 의자').
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.