GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

발행일
출처
arXiv
논문 번호
838
분야
Robotics
arXiv 번호
2608.06332

제한된 장면 데이터로 학습해도 새로운 환경으로 일반화하는 로봇 조작용 상호작용 세계 모델을 제안했다.

이 논문은 한마디로 로봇이 상상 속에서 다양한 환경과 상호작용하며 정책을 평가하고 개선할 수 있는 세계 모델을 만든 것이다. GeniWorld는 수치 행동 대신 시각적 행동 표현(URDF 렌더링)을 사용해, 로봇의 움직임과 환경 변화를 분리한다. 고정 장면 데이터로만 학습해도 새로운 객체·배경·조명에서 잘 작동하며, 합성 데이터로 정책 성공률을 40.8%에서 69.0%로 올렸다.

핵심 요약

  • 수치 행동 대신 URDF 렌더링 기반 시각 행동 표현으로 공간적 정확도를 높였다.
  • 로봇 운동학과 환경 역학을 분리해 장면 과적합을 줄이고 일반화를 개선했다.
  • 자기회귀 비디오 예측으로 폐루프 상호작용을 지원한다 (8 Hz, H20 GPU).
  • 제한된 실제 데이터만으로 OOD 환경에서 강건한 제로샷 일반화를 달성했다.
  • 세계 모델에서 합성한 궤적으로 전체 정책 성공률을 40.8%에서 69.0%로 향상시켰다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)