GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture

발행일
출처
arXiv
논문 번호
935
분야
Robotics
arXiv 번호
2608.15875

로봇이 장면을 이해하고 다음 상태를 예상하고 몸을 움직이는 세 기능을 묶어, 여러 기종과 과제에서 재사용하려는 대규모 기반 모델이다.

이 논문은 한마디로 로봇의 계획, 동작과 미래 예측을 세 체계로 나눈 GigaBrain-0.7을 제안한다. System 2는 장면과 과제를 이해하고, System 1은 연속 동작을 만들며, System 3는 미래 장면과 과제 진행도를 예측한다. 실물 로봇 16종을 포함한 여러 출처의 궤적 37,256.98시간과 시각 언어 표본 약 2억 7,200만 개로 이해와 동작을 함께 학습했다. 과제별 추가 학습 뒤 복합 조작 평균 성공률은 AgileX PiPER 84.9퍼센트, Maker H01 74.1퍼센트였다. 다만 과제당 실물 평가가 보통 10회에서 20회로 작고 분포 밖 조건에서는 성능이 떨어졌다.

핵심 요약

  • System 2는 PaliGemma2 3B로 장면과 과제를 이해한다. System 1은 PaliGemma2 3B와 0.5B 동작 모델로 제어값을 만들고, System 3는 5B 세계 모델로 미래 영상과 진행도를 예측한다.
  • 궤적 자료는 실물 로봇 20,535.65시간, UMI 사람 시연 8,251.83시간, 1인칭 사람 영상 2,862.36시간, 시뮬레이션 1,453.92시간과 세계 모델 생성 4,153.22시간으로 구성된다.
  • System 3 절제 실험에서 AgileX PiPER-X의 선물 포장 성공률은 기본 모델 0퍼센트에서 미래 영상과 진행도 조건을 함께 쓸 때 80퍼센트가 됐다. AgileX PiPER의 옷 접기 완료 시간은 107초에서 75초로 줄었다.
  • RoboTwin 2.0의 50개 과제에 과제당 깨끗한 시연 50개를 쓰고 한 정책을 함께 추가 학습한 Co-Train 조건에서 Easy 66.8퍼센트, Hard 67.9퍼센트와 평균 67.35퍼센트였다. 파이0.5는 각각 70.7퍼센트, 46.0퍼센트와 평균 58.35퍼센트였다.
  • 실물 로봇 과제는 설정당 보통 10회에서 20회만 평가했고 신뢰구간이 없다. 최종 MiMo 점수 0.5704도 평가 자료가 학습에 들어가 독립 시험 결과가 아니다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)