Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model

발행일
출처
arXiv
논문 번호
603
분야
Robotics
arXiv 번호
2607.11643

Xiaomi의 38B 멀티모달 자회귀 모델로, 이미지 생성·이미지 편집·embodied 장면 생성·embodied 전이·embodied 비디오 생성을 단일 프레임워크에서 통합한다. GPT-Image-2.0을 능가하며 로봇 정책의 OOD 성공률을 36.9%에서 63.2%로 향상시킨다.

Xiaomi-Robotics-U0는 38B 파라미터 멀티모달 자회귀 모델로, foundation world model의 일반화 능력을 보존하면서 embodied 환경으로 확장하는 최초의 통합 embodied synthesis 모델이다. 텍스트-이미지 생성, 이미지 편집, embodied 장면 생성, embodied 전이, embodied 비디오 생성을 jointly 학습하여, GPT-Image-2.0을 인간 평가에서 능가하고 World Arena 1위를 달성했으며, π0.5 로봇 정책의 OOD 성공률을 36.9%에서 63.2%로 크게 향상시켰다.

핵심 요약

  • 38B 파라미터 단일 자회귀 프레임워크에서 5가지 생성 태스크(이미지 생성, 편집, embodied 장면 생성, 전이, 비디오 생성)를 통합 학습
  • 구조화된 제어 포맷으로 작업공간·배경·전경·대상·조명을 독립 제어 차원으로 분리하여 multi-view 일관성 보존
  • GPT-Image-2.0을 embodied 장면 생성 및 전이에서 인간 평가 1위, World Arena embodied 비디오 생성 1위 달성
  • 생성된 합성 데이터로 π0.5 로봇 정책의 OOD 성공률을 36.9%→63.2%로 26.3%p 향상
  • 순차적 world modeling을 통해 정적 장면 생성에서 확장 가능한 궤적 생성 엔진으로 발전
  • 코드와 체크포인트를 공개하여 embodied intelligence 데이터 엔진으로 활용 가능

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)