RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
- 발행일
- 출처
- arXiv
- 논문 번호
- 865
- 분야
- Robotics
- arXiv 번호
- 2608.09853
이 논문은 로봇 학습의 병목인 보상 모델을 '시간적 거리(목표까지 얼마나 남았는가)'로 대체한 가치 기반 모델(RynnValue)을 만들었다. 선호도 라벨 없이 7,000시간 데이터로 학습해서 기존 최고 성능을 넘었다.
이 논문은 한마디로 로봇이 어떤 행동이 좋은지 판단하는 기준을 '목표까지 남은 시간'으로 통일한 가치 기반 모델을 제안했다. 기존은 사람이 일일이 좋고 나쁨을 판단(선호도 라벨)해야 했는데, 타임스탬프만 있으면 라벨이 자동으로 만들어진다. 7,000시간, 300만 클립으로 학습한 RynnValue는 선호도 라벨을 쓴 기존 최고 모델보다 더 정확했고, 실제 로봇 성공률을 52.5% → 72.5%로 올렸다.
핵심 요약
- 보상 모델의 감독 대상을 진행도에서 '시간적 거리(목표까지 cost-to-go)'로 바꿔 선호도 라벨 없이 확장 가능하게 했다.
- 7,000시간, 약 300만 클립의 이질적 로봇 데이터로 학습했다.
- 시간 순서 섞기와 값 격리 어텐션으로 모델이 학숫값에만 의존하지 않게 했다.
- 선호도 라벨을 쓴 기존 최고 모델(0.655)을 0.675로 넘어섰다.
- 실제 로봇 RL에서 온라인 52.5%→72.5%, 오프라인 63.8%→82.5% 성공률 향상을 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.