Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

발행일
출처
arXiv
논문 번호
684
분야
Robotics
arXiv 번호
2607.19190

VLM 에이전트가 실제 로봇 조작 영상을 물리 시뮬레이션 디지털 트윈으로 자동 변환하는 프레임워크.

이 논문은 한마디로 실제 로봇-물체 상호작용 녹화 영상을 물리 시뮬레이터(MuJoCo)에서 실행 가능한 디지털 트윈으로 자동 변환하는 시스템이다. 4개의 VLM 에이전트(시각 처리, 물리 추론, 씬 준비, 시뮬레이터 최적화)가 협력해서 작동하며, 31B 오픈 모델이 GPT-5.4의 3% 비용으로 비슷한 성공률을 보였다. DROID 데이터셋 100개 에피소드에서 48% 재생 성공률을 기록했고, 변형 가능한 물체(천, 밧줄)와 휴머노이드 모션까지 확장 가능함을 보였다.

핵심 요약

  • 실제 로봇 조작 녹화를 MuJoCo 시뮬레이션 에피소드로 자동 변환하는 4에이전트 파이프라인을 제안했다.
  • 31B 오픈 VLM이 GPT-5.4 대비 3% 비용으로 비슷한 변환 성공률(48/100)을 달성했다.
  • 강체 조작뿐 아니라 변형체(천, 밧줄)와 휴머노이드 모션까지 같은 프레임워크로 처리했다.
  • VLM 역할을 좁게 제한해서 백엔드 모델 교체가 쉽고 비용 효율적임을 보였다.
  • 변환된 에피소드 트윈은 로봇 정책 학습과 평가에 활용할 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)