Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation

발행일
출처
arXiv
논문 번호
422
분야
Computer Vision
arXiv 번호
2606.17030

Qwen-RobotWorld는 자연어를 통합 action interface로 사용하는 언어 조건부 비디오 world model로, 로봇 조작·자율주행·실내 네비게이션·인간-로봇 전이를 단일 프레임워크로 통합한다.

Double-stream MMDiT 아키텍처에 Qwen2.5-VL 기반 action encoding을 결합하고, 8.6M video-text pair(200M+ 프레임)의 EWK 데이터셋과 general+expert 점진적 커리큘럼으로 학습한다. 4개 벤치마크에서 강력한 성능을 보이며, 특히 EWMBench와 DreamGen Bench에서 1위를 달성했다. 자연어 명령 하나로 20+ 로봇 morphology에 일반화되는 것이 핵심 기여다.

핵심 요약

  • 자연어를 unified action interface로 사용하여 20+ embodiment, 500+ action category를 단일 언어 인터페이스로 표준화
  • Double-stream MMDiT (60-layer)에서 Qwen2.5-VL 의미 정보와 video-VAE latent를 layer-wise joint attention으로 융합
  • EWK 데이터셋: 8.6M video-text pair, 200M+ frames, manipulation 5.9M + 자율주행 200K + 네비게이션 6K+ 에피소드
  • EWMBench 1위(4.60, HSD +33% 우세), DreamGen Bench 1위(4.952), WorldModelBench 8.99(오픈소스 1위), PBench 0.804

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)