RL$^2$-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

발행일
출처
arXiv
논문 번호
766
분야
Robotics
arXiv 번호
2607.26991

VLA가 실패할 것 같을 때만 RL 기반 행동 다양화를 적용해, OOD 작업에서 +17.3% 성공률 향상을 달성한 적응형 스티어링.

이 논문은 한마디로 로봇 정책(VLA)이 잘 못할 것 같을 때만 개입해서 다양한 행동을 시도하게 만드는 방법이다. 핵심 통찰은: 잘하고 있을 때 건드리면 오히려 망가지고, 못하고 있을 때 다양성을 주면 회복된다는 것이다. RL²는 가벼운 RL 정책을 VLA의 잠재 표현 위에 얹어, 실패가 예측될 때만 행동 분포를 넓힌다. OOD 작업에서 최대 +17.3% 향상, 실제 로봇에서도 +17.5% 향상을 달성했다.

핵심 요약

  • VLA 잠재 표현 위에서 학습된 가벼운 RL 정책으로 구성적 스티어링(compositional steering)을 적용했다.
  • 성공 상태와 실패 상태에서 각각 다른 스케일링 법칙을 발견했다: 실패 때만 개입하는 것이 최적이다.
  • SAFE 실패 감지기를 통합해, 실패 예측 시에만 RL 스티어링을 활성화하는 적응형 메커니즘을 구축했다.
  • SIMPLER/PolaRiS 벤치마크 OOD 설정에서 최대 +17.3% 성공률 향상을 달성했다.
  • 실제 PiperX 로봇 실험에서도 +17.5% 향상으로 시뮬레이션 결과가 실제로 이전됨을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)