Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
- 발행일
- 출처
- arXiv
- 논문 번호
- 603
- 분야
- Robotics
- arXiv 번호
- 2607.11643
Xiaomi의 38B 멀티모달 자회귀 모델로, 이미지 생성·이미지 편집·embodied 장면 생성·embodied 전이·embodied 비디오 생성을 단일 프레임워크에서 통합한다. GPT-Image-2.0을 능가하며 로봇 정책의 OOD 성공률을 36.9%에서 63.2%로 향상시킨다.
Xiaomi-Robotics-U0는 38B 파라미터 멀티모달 자회귀 모델로, foundation world model의 일반화 능력을 보존하면서 embodied 환경으로 확장하는 최초의 통합 embodied synthesis 모델이다. 텍스트-이미지 생성, 이미지 편집, embodied 장면 생성, embodied 전이, embodied 비디오 생성을 jointly 학습하여, GPT-Image-2.0을 인간 평가에서 능가하고 World Arena 1위를 달성했으며, π0.5 로봇 정책의 OOD 성공률을 36.9%에서 63.2%로 크게 향상시켰다.
핵심 요약
- 38B 파라미터 단일 자회귀 프레임워크에서 5가지 생성 태스크(이미지 생성, 편집, embodied 장면 생성, 전이, 비디오 생성)를 통합 학습
- 구조화된 제어 포맷으로 작업공간·배경·전경·대상·조명을 독립 제어 차원으로 분리하여 multi-view 일관성 보존
- GPT-Image-2.0을 embodied 장면 생성 및 전이에서 인간 평가 1위, World Arena embodied 비디오 생성 1위 달성
- 생성된 합성 데이터로 π0.5 로봇 정책의 OOD 성공률을 36.9%→63.2%로 26.3%p 향상
- 순차적 world modeling을 통해 정적 장면 생성에서 확장 가능한 궤적 생성 엔진으로 발전
- 코드와 체크포인트를 공개하여 embodied intelligence 데이터 엔진으로 활용 가능
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.