InstructSAM: Segment Any Instance with Any Instructions

발행일
출처
arXiv
논문 번호
249
분야
Computer Vision
arXiv 번호
2605.26102

InstructSAM은 복잡한 자연어 지시에 따라 다중 인스턴스 분할을 수행하는 종단간 프레임워크를 제공하며, 명시적인 쿼리 기반 메커니즘을 통해 VLM과 SAM3를 통합한다.

InstructSAM은 자유 형식 지시를 만족하는 여러 객체를 한 번에 분할하기 위한 통합 프레임워크다. 비전-언어 모델 안에 학습 가능한 인스턴스 질의 묶음을 넣고, 각 질의가 서로 다른 대상의 슬롯으로 작동하도록 지시와 시각 정보를 결합한다. 혼합 어텐션으로 슬롯 사이 중복을 줄인 뒤 이 질의를 SAM3의 검출 질의 공간에 투영해 한 번의 순전파로 여러 마스크를 만든다. 연구진은 자유 형식 지시와 인스턴스 마스크를 연결한 Inst2Seg 데이터셋과 평가 기준도 구축했다. 2B 규모 모델의 실험은 복잡한 지시 및 구문 기반 분할에서 기존 종단간 방법과 여러 단계의 SAM3 에이전트 파이프라인보다 강한 결과를 보여준다.

핵심 요약

  • 디코딩 단계에서는 마지막으로 스코어 헤드가 쿼리가 유효한 대상 인스턴스에 해당하는지 판단하고, 분할 헤드가 이진 마스크를 생성한다.
  • 단일 대상의 경우 지시에서 언급된 하나의 특정 객체를 식별한다.
  • 다중 대상의 경우 복잡한 조건을 만족하는 모든 인스턴스를 찾는다(예: '모든 나무 의자').

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)