From Pixels to Words -- Towards Native One-Vision Models at Scale

발행일
출처
arXiv
논문 번호
253
분야
Computer Vision
arXiv 번호
2605.28820

S-Lab, NTU, SenseTime Research가 개발한 NEO-ov는 네이티브 인코더 프리 비전-언어 모델을 소개하며, 종단간 자기회귀 구조를 통해 단일 이미지, 다중 이미지, 비디오 이해를 공간 지능과 함께 통합한다.

NEO-ov는 별도 비전 인코더나 어댑터 없이 픽셀과 언어 토큰을 하나의 모델에서 끝까지 학습하는 네이티브 비전-언어 모델이다. 이 모델은 통합 시각 직렬화와 시공간 어텐션을 사용해 단일 이미지, 다중 이미지, 영상, 공간 지능을 같은 구조로 다룬다. 모듈 경계를 없애 픽셀과 단어의 초기 상호작용 및 프레임 사이 대응을 모델 내부에서 직접 학습하도록 설계했다. 실험에서는 강한 모듈형 모델과의 성능 격차를 크게 줄였고, 세밀한 시각 인식과 공간 추론에서 뚜렷한 장점을 보였다. 이 연구는 네이티브 구조가 대규모 통합 시각 모델의 실현 가능한 대안임을 보이며 코드와 모델도 공개한다.

핵심 요약

  • 인과적 종속성의 경우, 인덱스 j가 i보다 크거나 같으면 토큰의 표준 순차 순서를 따른다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)