DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 894
- 분야
- Computer Vision
- arXiv 번호
- 2608.13489
로봇이 명령한 대로 움직이는지까지 검증하는 액션 조건부 비디오 월드모델이다. WorldArena 2.0 트랙 1에서 1위.
이 논문은 한마디로 로봇의 행동(액션)을 입력하면 그 결과 장면이 어떻게 변할지 영상으로 예측하는 월드모델이다. 그냥 영상이 그럴듯한 게 아니라 명령한 팔 경로를 정확히 따르도록 3D 공간 좌표(SE(3))를 어텐션(데이터에서 중요한 부분에 집중하는 기법)에 직접 주입했다. 여기에 깊이 정보와 물체 추적 마스크를 덧대어 잡은 물체가 사라지는 실수를 막았다. 그 결과 WorldArena 2.0 챌린지 트랙 1에서 1위, 트랙 2에서 공동 2위를 기록했다.
핵심 요약
- 로봇 양팔의 3D 이동 경로를 어텐션에 기하학적으로 주입해서, 영상은 그럴듯한데 잘못된 팔을 움직이는 문제를 막았다.
- 깊이 예측 브랜치와 SAM3 마스크(물체 영역을 분리해주는 기법)로, 집은 물체가 영상 도중 사라지거나 뒤바뀌는 실수를 줄였다.
- 여러 단계로 생성하던 모델을 몇 단계로 압축하는 증류(큰 모델의 지식을 작은 모델에 옮기는 기법)로 빠른 배포를 가능하게 했다.
- WorldArena 2.0 트랙 1에서 31팀 중 1위(EWMScore-P 60.65), 트랙 2에서 공동 2위(67.19%)를 기록했다.
- WorldArena 1.0 오프라인 평가에서 76.88점으로 기존 최고 기록(73.64)보다 3.24점 높았다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.