DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation

발행일
출처
arXiv
논문 번호
894
분야
Computer Vision
arXiv 번호
2608.13489

로봇이 명령한 대로 움직이는지까지 검증하는 액션 조건부 비디오 월드모델이다. WorldArena 2.0 트랙 1에서 1위.

이 논문은 한마디로 로봇의 행동(액션)을 입력하면 그 결과 장면이 어떻게 변할지 영상으로 예측하는 월드모델이다. 그냥 영상이 그럴듯한 게 아니라 명령한 팔 경로를 정확히 따르도록 3D 공간 좌표(SE(3))를 어텐션(데이터에서 중요한 부분에 집중하는 기법)에 직접 주입했다. 여기에 깊이 정보와 물체 추적 마스크를 덧대어 잡은 물체가 사라지는 실수를 막았다. 그 결과 WorldArena 2.0 챌린지 트랙 1에서 1위, 트랙 2에서 공동 2위를 기록했다.

핵심 요약

  • 로봇 양팔의 3D 이동 경로를 어텐션에 기하학적으로 주입해서, 영상은 그럴듯한데 잘못된 팔을 움직이는 문제를 막았다.
  • 깊이 예측 브랜치와 SAM3 마스크(물체 영역을 분리해주는 기법)로, 집은 물체가 영상 도중 사라지거나 뒤바뀌는 실수를 줄였다.
  • 여러 단계로 생성하던 모델을 몇 단계로 압축하는 증류(큰 모델의 지식을 작은 모델에 옮기는 기법)로 빠른 배포를 가능하게 했다.
  • WorldArena 2.0 트랙 1에서 31팀 중 1위(EWMScore-P 60.65), 트랙 2에서 공동 2위(67.19%)를 기록했다.
  • WorldArena 1.0 오프라인 평가에서 76.88점으로 기존 최고 기록(73.64)보다 3.24점 높았다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)