From Pixels to Words -- Towards Native One-Vision Models at Scale
- 발행일
- 출처
- arXiv
- 논문 번호
- 253
- 분야
- Computer Vision
- arXiv 번호
- 2605.28820
S-Lab, NTU, SenseTime Research가 개발한 NEO-ov는 네이티브 인코더 프리 비전-언어 모델을 소개하며, 종단간 자기회귀 구조를 통해 단일 이미지, 다중 이미지, 비디오 이해를 공간 지능과 함께 통합한다.
NEO-ov는 별도 비전 인코더나 어댑터 없이 픽셀과 언어 토큰을 하나의 모델에서 끝까지 학습하는 네이티브 비전-언어 모델이다. 이 모델은 통합 시각 직렬화와 시공간 어텐션을 사용해 단일 이미지, 다중 이미지, 영상, 공간 지능을 같은 구조로 다룬다. 모듈 경계를 없애 픽셀과 단어의 초기 상호작용 및 프레임 사이 대응을 모델 내부에서 직접 학습하도록 설계했다. 실험에서는 강한 모듈형 모델과의 성능 격차를 크게 줄였고, 세밀한 시각 인식과 공간 추론에서 뚜렷한 장점을 보였다. 이 연구는 네이티브 구조가 대규모 통합 시각 모델의 실현 가능한 대안임을 보이며 코드와 모델도 공개한다.
핵심 요약
- 인과적 종속성의 경우, 인덱스 j가 i보다 크거나 같으면 토큰의 표준 순차 순서를 따른다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.