CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

발행일
출처
arXiv
논문 번호
1037
분야
Robotics
arXiv 번호
2608.27406

사람과 여러 로봇의 영상을 통째로 배워 물리 법칙을 이해하는 크로스바디 영상 월드모델 프레임워크. 제로샷 실과제 일반화를 보였다.

이 논문은 한마디로 서로 다른 로봇과 사람의 영상을 함께 배우는 크로스바디 영상 월드모델 CLAP을 제안했다. 물리 법칙은 행위자와 무관하다는 관점에서, 엔드이펙터(로봇 손끝) 좌표, 자연어, 잠재 행동이라는 세 가지 행동 표현을 통일해 인터넷 규모 영상에 학습한다. 라벨 없는 영상으로 잠재 행동을 먼저 배우고 엔드이펙터 행동으로 정밀화하는 커리큘럼 학습으로 제로샷 실과제 배치까지 이어진다. 단일 바디 SOTA에 근접하거나 능가했고, 월드모델 안에서 계획과 RL 파인튜닝으로 π0.5, MolmoAct-2 같은 최신 정책의 실과제 성공률을 올렸다.

핵심 요약

  • 서로 다른 로봇 플랫폼과 사람 영상을 한 모델에 함께 학습시키는 크로스바디 월드모델 프레임워크를 만들었다.
  • 엔드이펙터 좌표, 자연어, 잠재 행동 표현으로 서로 다른 행동 공간을 통일했다.
  • 라벨 없는 영상(잠재 행동)에서 엔드이펙터 행동으로 이어지는 커리큘럼 학습으로 제로샷 배치를 가능하게 했다.
  • DROID 등 도전 환경에서 단일 바디 SOTA에 근접하거나 능가했고, 소수 샘플 적응으로 격차를 더 벌렸다.
  • 월드모델 내 추론 시 계획과 RL 파인튜닝으로 π0.5, MolmoAct-2 실과제 성공률을 높였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)