G0.5: One Autoregressive Stream for Robot Reasoning and Action
- 발행일
- 출처
- arXiv
- 논문 번호
- 887
- 분야
- Robotics
- arXiv 번호
- 2608.11739
이 논문은 하나의 시각 언어 모델이 생각 과정과 로봇 동작을 같은 토큰 흐름으로 직접 생성하게 만든 로봇 제어 모델 G0.5를 제안했다.
이 논문은 한마디로 시각 언어 모델을 로봇의 상황 해석기뿐 아니라 실제 행동 결정자로 사용하는 방법을 제안한다. G0.5는 별도의 동작 생성 모델을 붙이지 않고 하나의 트랜스포머가 추론 토큰과 동작 토큰을 차례로 출력한다. 서로 다른 로봇의 동작을 공통 토큰으로 바꾸는 압축기, 과제 분해와 물체 위치를 포함한 생각 과정, 몇 초 동안의 영상을 활용하는 시각 기억 장치를 결합했다. 모든 출력은 하나의 다음 토큰 예측 목표로 학습한다.
핵심 요약
- 추론과 동작이 같은 모델 가중치와 같은 토큰 흐름을 사용하며 별도의 동작 전문가 모델을 두지 않는다.
- 실제 환경과 모의 환경의 로봇 14종을 학습하고, 서로 다른 동작 공간을 27차원 공통 공간과 하나의 토큰 사전으로 바꾼다.
- 생각 과정에는 하위 과제, 물체 위치, 2D 이동 경로와 동작 힌트가 들어가며 시각 기억은 최근 몇 초의 영상을 활용한다.
- 평균 성공률은 실제 로봇 76.7%, DROID의 새 환경과 물체 82.5%, LIBERO 98.9%, RoboTwin 2.0 93.3%, SimplerEnv-Bridge 87.3%였다.
- BEHAVIOR 장기 과제 점수는 31.4%로 비교 모델의 26.3%보다 높았지만, 시각 기억은 몇 초로 제한되고 하체 동작은 별도로 평가하지 않았다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.