Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation
- 발행일
- 출처
- arXiv
- 논문 번호
- 422
- 분야
- Computer Vision
- arXiv 번호
- 2606.17030
Qwen-RobotWorld는 자연어를 통합 action interface로 사용하는 언어 조건부 비디오 world model로, 로봇 조작·자율주행·실내 네비게이션·인간-로봇 전이를 단일 프레임워크로 통합한다.
Double-stream MMDiT 아키텍처에 Qwen2.5-VL 기반 action encoding을 결합하고, 8.6M video-text pair(200M+ 프레임)의 EWK 데이터셋과 general+expert 점진적 커리큘럼으로 학습한다. 4개 벤치마크에서 강력한 성능을 보이며, 특히 EWMBench와 DreamGen Bench에서 1위를 달성했다. 자연어 명령 하나로 20+ 로봇 morphology에 일반화되는 것이 핵심 기여다.
핵심 요약
- 자연어를 unified action interface로 사용하여 20+ embodiment, 500+ action category를 단일 언어 인터페이스로 표준화
- Double-stream MMDiT (60-layer)에서 Qwen2.5-VL 의미 정보와 video-VAE latent를 layer-wise joint attention으로 융합
- EWK 데이터셋: 8.6M video-text pair, 200M+ frames, manipulation 5.9M + 자율주행 200K + 네비게이션 6K+ 에피소드
- EWMBench 1위(4.60, HSD +33% 우세), DreamGen Bench 1위(4.952), WorldModelBench 8.99(오픈소스 1위), PBench 0.804
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.