Orca: The World is in Your Mind
- 발행일
- 출처
- arXiv
- 논문 번호
- 520
- 분야
- Computer Vision
- arXiv 번호
- 2606.30534
멀티모달 세계 신호로부터 통합된 world latent space를 학습하는 범용 세계 기반 모델 Orca를 제안한다. Next-State-Prediction이라는 새로운 패러다임으로 이해·예측·행동을 통합한다.
Orca는 비디오와 언어 신호로부터 세계 상태를 내부 표현(world latent)으로 학습하는 세계 기반 모델이다. 무의식적 학습(unconscious learning)으로 자연적 상태 전환을, 의식적 학습(conscious learning)으로 의미 있는 이벤트 수준의 전환을 포착하며, 125K시간 비디오와 160M 이벤트 annotation으로 사전학습한다. 학습된 latent는 텍스트 생성, 이미지 예측, 로봇 행동 생성이라는 세 가지 downstream readout에서 동일 크기의 특화 모델들을 능가하며, 모델 크기와 데이터 규모에 따른 확장성을 확인했다.
핵심 요약
- Next-Token/Frame/Action Prediction이 아닌 Next-State-Prediction을 통합 패러다임으로 제안
- 무의식적 학습(연속 비디오에서 밀집 상태 전환) + 의식적 학습(언어 조건부 희소 이벤트 전환)의 두 보완적 패러다임 설계
- 125K시간 비디오, 160M 이벤트 annotation 규모의 대규모 world-learning 데이터 구축
- Encoder 동결 후 lightweight decoder만 학습하여 텍스트·이미지·행동 readout 수행
- 4B/0.8B 규모에서 확장성 검증 완료, 더 큰 world latent가 더 강한 downstream 성능으로 직결
- 현재 비전·언어로 제한된 모달리티, 단기 horizon 전환, 제한된 모델 규모 등 명확한 한계도 공유
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.