RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
- 발행일
- 출처
- arXiv
- 논문 번호
- 665
- 분야
- Robotics
- arXiv 번호
- 2607.17977
알리바바 DAMO가 로봇 조작에 바로 붙는 체화 기반모델 RynnBrain 1.1(2B, 9B, 122B-A10B)을 내놓고, 여러 종류의 로봇 몸체를 하나의 행동 공간으로 묶은 VLA 정책까지 실물 로봇에서 검증했다.
로봇이 쓸 수 있는 시각언어모델은 보통 "보고 이해하는" 데서 멈추고, 실제 팔을 움직이는 행동으로 이어지지 않는다는 문제가 있다. 연구진은 Qwen3.5를 바탕으로 2B, 9B, 122B-A10B 세 크기의 체화 기반모델을 같은 학습 틀로 만들고, 잡을 지점과 그리퍼 회전각을 찍는 접촉점 예측과 언어로 지시하는 3D 위치찾기를 사전학습 과제로 새로 넣었다. 그 위에 여러 로봇에 공통으로 쓰는 통합 행동 공간과 몸체별 마스킹을 붙인 RynnBrain-VLA를 만들어 Unitree G1, Astribot-S1, Tianji-Wuji 세 플랫폼에 올렸다. 122B-A10B는 VSI-Bench, MMSI, RefSpatial-Bench에서 비교한 상용 및 공개 모델을 모두 앞섰고, 실물 로봇에서 평균 성공률이 Qwen 기반 정책 60.00%에서 86.67%로 올랐다.
핵심 요약
- 핵심 주장은 시각 이해를 잘하는 것만으로 부족하고, 표현과 출력이 로봇 조작에 바로 쓰이는 형태여야 한다는 것이다.
- 방법으로 접촉점 예측(잡을 중심점과 그리퍼 평면 회전각)과 네이티브 3D 위치찾기를 사전학습 과제로 추가했고, 3D 위치찾기는 2B와 9B 모델에 들어간다.
- 구조는 Qwen3.5 기반의 디코더 전용 시각언어모델이며, DeepStack과 Interleaved MRoPE로 이미지, 여러 시점 이미지, 영상을 길게 다룬다.
- 여러 로봇을 한 정책으로 묶기 위해 몸 부위별로 의미를 맞춘 통합 행동 공간을 두고, 로봇마다 있는 축만 켜는 마스킹을 적용했다.
- 결과로 실물 로봇 3개 과제 평균 성공률이 RynnBrain-VLA 86.67%, GR00T N1.7 73.33%, π0.5 65.00%, Qwen 기반 60.00%였다.
- 여러 과제와 여러 로봇을 함께 학습한 제너럴리스트 버전이 과제별 개별 학습보다 오히려 나아서(성공률 86.67%에서 91.67%), 이종 로봇 데이터가 서로를 보완한다는 근거를 보였다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.