Visual General Intelligence: A White Paper
- 발행일
- 출처
- arXiv
- 논문 번호
- 1019
- 분야
- Computer Vision
- arXiv 번호
- 2608.25924
'지능이 언어 말고 시각에서도 나올 수 있는가'를 묻는 비전 중심 AGI(VGI) 선언문. CVPR 2026 워크숍 참여자들의 관점을 모은 포지션 페이퍼.
이 논문은 한마디로 'AGI로 가는 길이 언어 모델만이 아니라 시각 학습에도 있다'는 비전 커뮤니티의 공동 성명이다. GPT가 텍스트 대규모 학습으로 예상 밖 능력을 얻었듯, 영상·기하 같은 시각 데이터에서도 비슷한 창발이 가능한지 묻는다. 대규모 생성 학습, 지속 학습, 능동 지각, 공간 메모리 같은 후보 경로를 여러 저자의 관점으로 펼친다. 단일 정의를 강요하지 않고, VGI 평가는 정적 벤치마크를 넘어 전이·적응·창의성을 봐야 한다고 주장한다.
핵심 요약
- 여러 연구자의 관점을 모아 언어보다 훨씬 오래된 시각 경험이 일반 지능으로 가는 독자적인 출발점이 될 수 있는지 검토했다.
- 대규모 생성 학습과 미래 예측, 공간 기억, 지속 학습, 능동 지각, 몸을 통한 상호작용을 시각 지능의 후보 경로로 제시했다.
- 평가는 고정 과제 점수를 넘어 새로운 상황으로의 전이, 지속 적응, 창의성, 물리적 일관성, 능동적 정보 탐색을 봐야 한다고 주장했다.
- 비전 단독과 비전 우선, 언어 결합 등 여러 경로를 열어 두고 시각 일반 지능을 하나의 모델이나 정의로 성급히 고정하지 말자고 결론지었다.
- 이 연구는 새 모델이나 통합 실험을 제시한 논문이 아니라 연구 의제를 정리한 백서이며, 현재의 시각 능력도 서로 분절돼 있고 계산 비용과 시간 범위의 한계가 있다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.