Vision as Unified Multimodal Generation

발행일
출처
arXiv
논문 번호
576
분야
Computer Vision
arXiv 번호
2607.06560

SenseNova-Vision은 컴퓨터 비전의 모든 태스크를 단일 통합 멀티모달 생성 모델로 표현하여, 태스크별 헤드 없이도 전문 시스템 수준의 성능을 달성한다.

SenseNova-Vision은 컴퓨터 비전의 이질적 태스크(탐지, 세분화, 깊이, 법선, 다시점 3D 등)를 단일 통합 멀티모달 모델(UMM)의 텍스트+이미지 생성 공간으로 통합한다. 자연어 명령과 시각 프롬프트로 태스크를 지정하면, 모델이 텍스트(기호记录), 이미지(밀집 공간 예측), 혼합 출력으로 응답한다. SenseNova-Vision Corpus라는 대규모 비전 명령-응답 코퍼스를 구축하여, Bagel UMM 기반으로 태스크별 헤드나 아키텍처 변경 없이 학습했다.

핵심 요약

  • 단일 UMM으로 구조화 비전 이해·밀집 기하 예측·세분화·다시점 3D를 통합, 태스크별 헤드 불필요
  • 텍스트 생성은 기호 출력(탐지, OCR, 키포인트, 카메라 포즈), 이미지 생성은 밀집 예측(깊이, 법선, 마스크, 포인트맵)을 담당
  • SenseNova-Vision Corpus: 이질적 비전 어노테이션을 명령-응답 예제로 변환한 대규모 학습 코퍼스
  • 구조화 비전 이해에서 리딩 시스템 능가, 밀집 기하/세분화에서 최고 수준 전문 시스템과 근접
  • 언어로 태스크 변형을 자유롭게 정의 가능(색상, 영역, 카테고리 조합 등 훈련에 없는 새 변형도 수행)
  • 모델과 코퍼스를 공개(open-source)하여 재현 가능한 연구 기반 제공

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)