$R^3$: Training Robots to Reason in Natural Language via Reinforcement Learning

발행일
출처
arXiv
논문 번호
1024
분야
Robotics
arXiv 번호
2608.26053

로봇이 행동 전에 자연어로 '생각'하게 훈련시켜 하위 정책을 조종하게 만든 논문. 전문가 추론 흔적 초기화 후 루브릭 RL로 다듬는 2단계 레시피.

이 논문은 한마디로 로봇 팔을 움직이기 전에 VLM이 자연어로 추론하도록 훈련시키는 방법이다. 상위 VLM(추론자)이 장면과 상호작용 히스토리를 보고 자연어 지시를 내리면, 고정된 하위 정책이 그 지시를 따라 움직인다. 학습은 전문가 추론 흔적으로 추론 스타일을 잡는 미드트레이닝과, 오프라인 데이터에 루브릭 기반 RL을 얹는 2단계로 이뤄진다. 식료품 포장(양팔 장기 과제)에서 지시만 흉내낸 모방학습(38.0%)을 47.9%로 크게 앞섰고, 자연어 추론이 실제로 테스트타임 컴퓨트로 기능함을 보였다.

핵심 요약

  • 언어 추론을 학습 보조 신호로만 쓰던 기존 방식과 달리, 테스트타임에 추론을 실제로 생성해 하위 정책을 조종하게 했다.
  • 1단계는 전문가 추론가의 흔적(성공·실패 무관)으로 추론 스타일을 초기화하고, 2단계는 VLM 심판의 루브릭 보상으로 오프라인 RL(Dr. GRPO)을 돌린다.
  • 식료품 포장 12개 홀드아웃 과제에서 평균 성공률 47.9%로 지시만 쓰는 모방학습(38.0%)을 이겼다.
  • 학습된 추론자는 대안 비교, 불확실할 때 장면 재관찰, 점진적 단계 선택 같은 신중한 행동 지향 추론을 보였다.
  • 추론 예산을 조절하는 개입 실험으로 추론이 성능에 인과적으로 기여함을 확인했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)