RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model

발행일
출처
arXiv
논문 번호
665
분야
Robotics
arXiv 번호
2607.17977

알리바바 DAMO가 로봇 조작에 바로 붙는 체화 기반모델 RynnBrain 1.1(2B, 9B, 122B-A10B)을 내놓고, 여러 종류의 로봇 몸체를 하나의 행동 공간으로 묶은 VLA 정책까지 실물 로봇에서 검증했다.

로봇이 쓸 수 있는 시각언어모델은 보통 "보고 이해하는" 데서 멈추고, 실제 팔을 움직이는 행동으로 이어지지 않는다는 문제가 있다. 연구진은 Qwen3.5를 바탕으로 2B, 9B, 122B-A10B 세 크기의 체화 기반모델을 같은 학습 틀로 만들고, 잡을 지점과 그리퍼 회전각을 찍는 접촉점 예측과 언어로 지시하는 3D 위치찾기를 사전학습 과제로 새로 넣었다. 그 위에 여러 로봇에 공통으로 쓰는 통합 행동 공간과 몸체별 마스킹을 붙인 RynnBrain-VLA를 만들어 Unitree G1, Astribot-S1, Tianji-Wuji 세 플랫폼에 올렸다. 122B-A10B는 VSI-Bench, MMSI, RefSpatial-Bench에서 비교한 상용 및 공개 모델을 모두 앞섰고, 실물 로봇에서 평균 성공률이 Qwen 기반 정책 60.00%에서 86.67%로 올랐다.

핵심 요약

  • 핵심 주장은 시각 이해를 잘하는 것만으로 부족하고, 표현과 출력이 로봇 조작에 바로 쓰이는 형태여야 한다는 것이다.
  • 방법으로 접촉점 예측(잡을 중심점과 그리퍼 평면 회전각)과 네이티브 3D 위치찾기를 사전학습 과제로 추가했고, 3D 위치찾기는 2B와 9B 모델에 들어간다.
  • 구조는 Qwen3.5 기반의 디코더 전용 시각언어모델이며, DeepStack과 Interleaved MRoPE로 이미지, 여러 시점 이미지, 영상을 길게 다룬다.
  • 여러 로봇을 한 정책으로 묶기 위해 몸 부위별로 의미를 맞춘 통합 행동 공간을 두고, 로봇마다 있는 축만 켜는 마스킹을 적용했다.
  • 결과로 실물 로봇 3개 과제 평균 성공률이 RynnBrain-VLA 86.67%, GR00T N1.7 73.33%, π0.5 65.00%, Qwen 기반 60.00%였다.
  • 여러 과제와 여러 로봇을 함께 학습한 제너럴리스트 버전이 과제별 개별 학습보다 오히려 나아서(성공률 86.67%에서 91.67%), 이종 로봇 데이터가 서로를 보완한다는 근거를 보였다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)