SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

발행일
출처
arXiv
논문 번호
450
분야
Robotics
arXiv 번호
2606.18610

사전 훈련된 비디오 파운데이션 모델을 로봇 정책 평가자로 적응시키는 방법이다. 순방향-역방향 역학 일관성, 교차 뷰 일관성, 테스트타임 일관성의 3가지 자기일관성 원칙으로 실제 로봇 성능과 0.929 Pearson 상관을 달성했다.

SC3-Eval은 비디오 파운데이션 모델을 폐루프 로봇 정책 평가자로 변환하는 레시피이다. 순방향-역방향 역학 일관성으로 드리프트를 억제하고, 교차 뷰 일관성으로 다중 카메라 관측 일관성을 유지하며, 테스트타임 일관성으로 불확실한 롤아웃을 조기 종료한다. 7개 VLA 정책에서 Pearson 0.929, MMRV 0.119를 달성하며 3개 SOTA 기반선을 능가했고, 단순 성공률 예측을 넘어 정책의 구체적 실패 모드까지 재현한다.

핵심 요약

  • 순방향-역방향 역학 joint training으로 autoregressive 롤아웃 드리프트를 역방향 신호로 보정
  • 교차 뷰 inpainting 훈련으로 명시적 메모리 없이 다중 카메라 일관성 유지
  • 역방향 역학 모드를 per-chunk 불확실성 신호로 재사용하여 드리프트 시 조기 종료
  • 7개 실제 VLA 정책에서 closed-loop Pearson 0.929, MMRV 0.119 달성 (Ctrl-World, IRASim, Cosmos-Predict 2.5 대비 우위)
  • 정책의 실제 실패 모드(언어 이해/물체 들기/놓기)를 4카테고리로 분류하여 70%+ 재현율 달성
  • 381시간 실제 table bussing 데이터로 훈련, OOD 작업에도 일반화 가능함을 입증

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)