Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

발행일
출처
arXiv
논문 번호
591
분야
Computer Vision
arXiv 번호
2607.08127

비디오 기반 로봇 행동 모델(VAM)에서 compositional generalization 격차를 분석하고, attention 기반 지표인 Temporal Ratio(TR)를 통해 이를 진단·완화하는 연구다.

생성형 비디오 파운데이션 모델이 강한 compositional prior를 가지고 있어도, 로봇 행동 데이터로 파인튜닝하면 이 능력이 사라지는 현상을 Video-Action Generalization(VAG) gap으로 정의했다. 저자들은 action head가 미래 예측 latent에 얼마나 의존하는지를 측정하는 attention 기반 지표 Temporal Ratio(TR)를 제안했는데, TR이 높을수록 compositional generalization 능력이 강하다는 것을 발견했다. TR은 task phase에 따라 자연스럽게 변하는데, planning 단계에서는 올라가고 정밀 조작 단계에서는 내려간다. 이를 활용한 TR-Adaptive Guidance를 적용하면 inference 시점에서 OOD 성능을 크게 향상시킬 수 있다.

핵심 요약

  • VAG gap: 비디오 파운데이션 모델의 compositional prior가 로봇 행동 파인튜닝 후 상실되는 현상을 체계적으로 정의하고 분석
  • Temporal Ratio(TR): action head의 attention이 현재 프레임 대비 미래 latent rollout에 얼마나 집중하는지를 측정하는 지표로, compositional generalization 능력의 예측 변수로 작동
  • TR은 task phase에 따라 동적 변화: planning 단계에서 상승, 정밀 manipulation 단계에서 하강 — 이는 자연스러운 attention 패턴
  • TR-Adaptive Guidance: planning 구간에서 compositional conditioning 신호를 적응적으로 증폭하는 inference-time 기법
  • LIBERO 벤치마크에서 OOD 평균 성공률을 기존 VAM 대비 5배 이상 향상 (기존 ~10% → 가이드 적용 59.4%)
  • 실제 bimanual 로봇 작업(YAM)에서도 평균 83.3% 달성, π0(36.7%)과 π0.5(55.0%)를 크게 상회

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)