Cosmos 3: Omnimodal World Models for Physical AI
- 발행일
- 출처
- arXiv
- 논문 번호
- 347
- 분야
- Computer Vision
- arXiv 번호
- 2606.02800
NVIDIA가 언어, 이미지, 비디오, 오디오, 액션 시퀀스를 단일 mixture-of-transformers 아키텍처에서 공동 처리·생성하는 옴니모달 월드 모델 Cosmos 3를 발표한다. 오픈소스 Text-to-Image 및 Image-to-Video 최고 성능을 기록했다.
Cosmos 3는 Physical AI를 위한 옴니모달 월드 모델 제품군으로, 언어·이미지·비디오·오디오·액션을 단일 mixture-of-transformers(MoT) 아키텍처에서 처리한다. 비전-언어 모델, 비디오 생성기, 월드 시뮬레이터, 월드-액션 모델을 하나의 프레임워크로 통합하며, 듀얼-타워 레이어와 듀얼-스트림 joint attention을 특징으로 한다. 모델은 이해(reasoner)와 생성(generator) 두 변종으로 제공되며, Super와 Nano 두 규모로 공개된다. 평가 결과 다양한 이해·생성 태스크에서 새로운 SOTA를 달성했고, Artificial Analysis 기준 최고의 오픈소스 Text-to-Image 및 Image-to-Video 모델로 선정되었으며, RoboArena에서 최고의 정책 모델로 평가되었다. 코드, 모델 가중치, 합성 데이터셋, 평가 벤치마크가 Linux Foundation OpenMDW-1.1 라이선스로 공개된다.
핵심 요약
- 단일 mixture-of-transformers 아키텍처로 언어, 이미지, 비디오, 오디오, 액션의 입력-출력을 유연하게 지원하는 옴니모달 설계다.
- 듀얼-타워 레이어 구조와 듀얼-스트림 joint attention으로 멀티모달 정보를 효과적으로 결합한다.
- 이해(reasoner)와 생성(generator) 두 역할을 모두 수행하며, Super/Nano 두 규모로 공개된다.
- 합성 데이터셋(SDG-PhyxSim, SDG-RobotSim, SDG-DriveSim 등)을 대규모로 구축하여 학습에 활용한다.
- Artificial Analysis 기준 최고의 오픈소스 Text-to-Image, Image-to-Video 모델이자 RoboArena 최고의 정책 모델로 평가되었다.
- 코드, 체크포인트, 데이터셋, 평가 벤치마크를 Linux Foundation OpenMDW-1.1 라이선스로 완전 공개한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.