Vision as Unified Multimodal Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 576
- 분야
- Computer Vision
- arXiv 번호
- 2607.06560
SenseNova-Vision은 컴퓨터 비전의 모든 태스크를 단일 통합 멀티모달 생성 모델로 표현하여, 태스크별 헤드 없이도 전문 시스템 수준의 성능을 달성한다.
SenseNova-Vision은 컴퓨터 비전의 이질적 태스크(탐지, 세분화, 깊이, 법선, 다시점 3D 등)를 단일 통합 멀티모달 모델(UMM)의 텍스트+이미지 생성 공간으로 통합한다. 자연어 명령과 시각 프롬프트로 태스크를 지정하면, 모델이 텍스트(기호记录), 이미지(밀집 공간 예측), 혼합 출력으로 응답한다. SenseNova-Vision Corpus라는 대규모 비전 명령-응답 코퍼스를 구축하여, Bagel UMM 기반으로 태스크별 헤드나 아키텍처 변경 없이 학습했다.
핵심 요약
- 단일 UMM으로 구조화 비전 이해·밀집 기하 예측·세분화·다시점 3D를 통합, 태스크별 헤드 불필요
- 텍스트 생성은 기호 출력(탐지, OCR, 키포인트, 카메라 포즈), 이미지 생성은 밀집 예측(깊이, 법선, 마스크, 포인트맵)을 담당
- SenseNova-Vision Corpus: 이질적 비전 어노테이션을 명령-응답 예제로 변환한 대규모 학습 코퍼스
- 구조화 비전 이해에서 리딩 시스템 능가, 밀집 기하/세분화에서 최고 수준 전문 시스템과 근접
- 언어로 태스크 변형을 자유롭게 정의 가능(색상, 영역, 카테고리 조합 등 훈련에 없는 새 변형도 수행)
- 모델과 코퍼스를 공개(open-source)하여 재현 가능한 연구 기반 제공
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.