VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

발행일
출처
arXiv
논문 번호
561
분야
Robotics
arXiv 번호
2607.01804

VLA 정책의 action chunk open-loop 맹점을 해결하는 경량 보정 프레임워크다. 40M 파라미터 비전 모니터가 실시간으로 궤도 이탈을 감지해 action을 자르고, gradient guidance로 회복 방향으로 재계획을 유도한다.

VLA-Corrector는 비전-언어-액션(VLA) 정책의 action chunk 실행 중 발생하는 누적 오차를 감지하고 보정하는 inference-time 프레임워크다. 백본 가중치를 동결한 채 Latent-space Vision Monitor(LVM, 40M)가 예측/실제 시각 역학의 편차를 추적하고, 지속적 이탈 감지 시 action chunk를 즉시 절단한 뒤 Online Gradient Guidance(OGG)로 회복 지향적 재추론을 수행한다. π0.5에서 horizon 50 기준 성공률 48.7%→58.7%, 실제 로봇 실험에서 평균 55.6%→73.3% 향상을 달성했다.

핵심 요약

  • 핵심 문제의식: 고정 action horizon에서 H가 길수록 정책 호출 비용은 절감되나 open-loop 맹점으로 누적 오차 발생
  • LVM(40M)이 latent space에서 시각적 동태 편차를 실시간 감지—백본 재학습 불필요(plug-and-play)
  • 적응형 action horizon: 신뢰 구간에서는 긴 chunk 유지, 이탈 감지 시 즉시 절단 후 OGG 재추론
  • π0.5 horizon 50: 성공률 48.7%→58.7%, 평균 호출 5.15→4.98로 success-per-call 효율 +24.6%
  • 실세계 교란 회복: 기존 40.0%→68.3%(+28.3%), 정밀 정렬 작업 +16.6% 향상
  • 절단의 83.7%가 critical phase(파지·정렬)에서 발생—모니터가 의미있는 시점을 올바로 포착

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)