RoboDream: Compositional World Models for Scalable Robot Data Synthesis
- 발행일
- 출처
- arXiv
- 논문 번호
- 287
- 분야
- Robotics
- arXiv 번호
- 2606.02577
로봇 학습을 확장하려면 대규모의 다양한 시연이 필요하지만, 원격 조작을 통한 실세계 데이터 수집은 여전히 엄청나게 비싸고 시간이 많이 든다.
RoboDream은 적은 로봇 시연으로 새로운 물체·장면·시점의 사실적인 학습 영상을 합성하는 신체 중심 월드 모델이다. 렌더링한 로봇 동작을 생성의 기준으로 고정하고 장면과 물체 정보를 별도 조건으로 주어, 동작 궤적과 환경의 외형을 분리해 조합한다. 기존 궤적을 다른 환경에서 재사용하는 검색·재생 방식과, 작업자가 빈 공간을 조작한 뒤 모델이 물체와 장면을 채우는 소품 없는 원격조작 방식을 지원한다. 실제 로봇 실험에서는 이 합성 데이터를 더했을 때 다양한 조작 과제의 정책 성능이 꾸준히 좋아지고 필요한 실세계 데이터가 줄었다. 이는 비디오 확산을 단순한 외형 증강이 아니라 물리적으로 정해진 로봇 동작을 유지하는 데이터 생성 장치로 활용할 수 있음을 보여준다.
핵심 요약
- 이 논문은 새로운 객체, 새로운 장면, 새로운 시점에서 사실적인 시연을 합성하여 확장 가능한 데이터 생성을 달성하는 일반화 가능한 신체 중심 월드 모델을 제안한다.
- 이 접근법은 생성을 렌더링된 로봇 동작에 고정하면서 명시적인 장면 및 객체 사전 정보를 조건으로 삼아, 궤적 실행을 환경 합성으로부터 효과적으로 분리한다.
- 실세계 실험을 통해 생성한 데이터가 다양한 조작 과제 전반에서 다운스트림 정책 성능을 일관되게 향상시키고 실세계 데이터 요구량을 크게 줄임을 보여준다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.