GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions
- 발행일
- 출처
- arXiv
- 논문 번호
- 838
- 분야
- Robotics
- arXiv 번호
- 2608.06332
제한된 장면 데이터로 학습해도 새로운 환경으로 일반화하는 로봇 조작용 상호작용 세계 모델을 제안했다.
이 논문은 한마디로 로봇이 상상 속에서 다양한 환경과 상호작용하며 정책을 평가하고 개선할 수 있는 세계 모델을 만든 것이다. GeniWorld는 수치 행동 대신 시각적 행동 표현(URDF 렌더링)을 사용해, 로봇의 움직임과 환경 변화를 분리한다. 고정 장면 데이터로만 학습해도 새로운 객체·배경·조명에서 잘 작동하며, 합성 데이터로 정책 성공률을 40.8%에서 69.0%로 올렸다.
핵심 요약
- 수치 행동 대신 URDF 렌더링 기반 시각 행동 표현으로 공간적 정확도를 높였다.
- 로봇 운동학과 환경 역학을 분리해 장면 과적합을 줄이고 일반화를 개선했다.
- 자기회귀 비디오 예측으로 폐루프 상호작용을 지원한다 (8 Hz, H20 GPU).
- 제한된 실제 데이터만으로 OOD 환경에서 강건한 제로샷 일반화를 달성했다.
- 세계 모델에서 합성한 궤적으로 전체 정책 성공률을 40.8%에서 69.0%로 향상시켰다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.