Robot-Factored World Models via Robot Rendering

발행일
출처
arXiv
논문 번호
723
분야
Robotics
arXiv 번호
2607.22535

로봇 월드 모델이 액션을 직접 학습하는 부담을 줄이려고, 로봇 동작을 미리 렌더링해서 시각 정보로 입력하는 방법이다.

이 논문은 한마디로 로봇 월드 모델이 액션(제어 명령)을 직접 이해하려는 부담을 줄이기 위해, 로봇 동작을 미리 렌더링해서 시각 정보로 제공하는 방법이다. 핵심 아이디어는 액션을 로봇의 컨트롤러와 운동학으로 먼저 '명목 궤적(nominal trajectory)'으로 변환한 뒤, 이를 URDF(로봇 모델)로 렌더링하여 카메라 시점의 로봇 형상으로 만드는 것이다. 이렇게 하면 월드 모델은 로봇 모양 없이 장면이 어떻게 반응하는지만 학습하면 된다. 서로 다른 로봇에도 적용 가능하고 인간 동작을 로봇 동작으로 변환해 입력할 수도 있다.

핵심 요약

  • 액션을 로봇 컨트롤러로 '명목 궤적'으로 변환 후 렌더링하여 입력함으로써, 미래 상태 누출 없이 액션 정보를 전달한다.
  • 엔드이펙터 깊이와 장면 깊이를 추가해 2D 이미지 평면에서 불가능한 접촉·가림 판단을 가능하게 했다.
  • SVD·Wan 백본 모두에서 기존 벡터 조건부(baseline) 대비 PSNR·SSIM·LPIPS 전 항목 향상.
  • 학습에 사용되지 않은 새로운 로봇(xArm6 + Inspire F1)의 움직임도 렌더링만 바꿔주면 제로샷 적용 가능하다.
  • 인간 조작 영상의 손 동작을 로봇으로 재타겟팅하여 렌더링하면 로봇 조작 비디오를 생성할 수 있다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)