$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1024
- 분야
- Robotics
- arXiv 번호
- 2608.26053
로봇이 행동 전에 자연어로 '생각'하게 훈련시켜 하위 정책을 조종하게 만든 논문. 전문가 추론 흔적 초기화 후 루브릭 RL로 다듬는 2단계 레시피.
이 논문은 한마디로 로봇 팔을 움직이기 전에 VLM이 자연어로 추론하도록 훈련시키는 방법이다. 상위 VLM(추론자)이 장면과 상호작용 히스토리를 보고 자연어 지시를 내리면, 고정된 하위 정책이 그 지시를 따라 움직인다. 학습은 전문가 추론 흔적으로 추론 스타일을 잡는 미드트레이닝과, 오프라인 데이터에 루브릭 기반 RL을 얹는 2단계로 이뤄진다. 식료품 포장(양팔 장기 과제)에서 지시만 흉내낸 모방학습(38.0%)을 47.9%로 크게 앞섰고, 자연어 추론이 실제로 테스트타임 컴퓨트로 기능함을 보였다.
핵심 요약
- 언어 추론을 학습 보조 신호로만 쓰던 기존 방식과 달리, 테스트타임에 추론을 실제로 생성해 하위 정책을 조종하게 했다.
- 1단계는 전문가 추론가의 흔적(성공·실패 무관)으로 추론 스타일을 초기화하고, 2단계는 VLM 심판의 루브릭 보상으로 오프라인 RL(Dr. GRPO)을 돌린다.
- 식료품 포장 12개 홀드아웃 과제에서 평균 성공률 47.9%로 지시만 쓰는 모방학습(38.0%)을 이겼다.
- 학습된 추론자는 대안 비교, 불확실할 때 장면 재관찰, 점진적 단계 선택 같은 신중한 행동 지향 추론을 보였다.
- 추론 예산을 조절하는 개입 실험으로 추론이 성능에 인과적으로 기여함을 확인했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.