Learning to Act While Waiting: RL Finetuning of Generalist Robot Policies Under Inference Latency
- 발행일
- 출처
- arXiv
- 논문 번호
- 1033
- 분야
- Robotics
- arXiv 번호
- 2608.23831
로봇 정책을 RL로 미세조정할 때 추론 지연 때문에 생기는 비마르코프 문제를, 확정된 행동과 추론 중간 관측을 상태에 넣어 해결한 프레임워크(ARLI).
이 논문은 한마디로 VLA 같은 큰 로봇 정책을 실제 지연 환경에서도 RL로 개선할 수 있게 만든 ARLI 프레임워크다. 큰 모델은 동작 하나 뽑는 데 100~300ms 걸려서, 비동기 추론과 RL을 섞으면 마르코프 가정(다음 상태가 현재 상태·행동만으로 결정된다는 가정)이 깨져 학습이 아예 실패한다. ARLI는 이미 확정된 행동과 추론 중간 시점의 관측을 상태에 추가해 근사 마르코프 구조를 복원하고, 저지연 RL 정책이 추론 창 안에서 반응성을 최대화하게 설계했다. 시뮬레이션과 실제 양팔 로봇(UR5e) 과제에서 표준 RL이 완전히 실패하는 지연 조건에서도 학습이 되고, 지연 없는 이상 환경의 표준 RL과 동등 이상 성능을 냈다.
핵심 요약
- VLA의 추론 지연(100~300ms)이 환경 다이내믹스를 바꿔 RL의 마르코프 가정을 깬다는 실패 원인을 규명했다.
- 확정된 행동과 추론 중간 관측을 상태에 넣는 증강으로 근사 마르코프 구조를 복원했다.
- 표준 RL이 완전히 실패하는 지연 조건에서도 안정적인 파인튜닝을 가능하게 했다.
- 지연 없는 이상 조건의 표준 RL 성능과 동등하거나 그 이상을 냈다.
- 실제 양팔 UR5e 로봇 3개 과제에서 비동기 추론 하의 실세계 개선을 입증했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.