Guava: An Effective and Universal Harness for Embodied Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 452
- 분야
- Robotics
- arXiv 번호
- 2606.18363
embodied 조작을 위한 harness 프레임워크로, 반복적 인식-추론-액션 루프, 의미적 액션 추상화, 멀티모달 관측의 3가지 핵심 설계 원칙을 제안한다. 2K 시뮬레이션 궤적으로 4B 모델을 학습해 상용 대형 모델과 동급 성능을 달성했다.
Guava는 embodied 조작을 위한 범용 harness 프레임워크로, ReAct 스타일의 반복적 인식-추론-액션 루프, 의미적 액션 추상화, 풍부한 멀티모달 관측의 3가지 설계 원칙을 체계적으로 탐구하여 도출했다. 2K 미만의 시뮬레이션 궤적으로 4B 오픈소스 모델을 distill하여, GPT-5.4 수준의 조작 성능을 시뮬레이션과 실제 환경 모두에서 달성했다. RL 후훈련으로 long-horizon 과제에서 shell game 6.7%→60%, place all red objects 0%→93.3%의 큰 개선을 보였으며, 훈련에서 보지 못한 실패 상황에서도 회복 행동을 보여준다.
핵심 요약
- ReAct 스타일의 폐루프 실행이 one-shot 계획 대비 long-horizon 과제에서 결정적 우위
- 의미적 액션 공간(grasp, align, move 등)이 저수준 joint 제어 대비 VLM 추론 부담 감소
- 2K 미만 시뮬레이션 궤적으로 4B 모델 학습 → 실제 환경 zero-shot 전달 성공 (ID 86%, OOD 92%)
- RL 후훈련으로 shell game 6.7%→60%, place all red objects 0%→93.3% 급격한 향상
- 훈련에 없는 관절 한계/도달 불가 상황에서도 오류 인식 및 회복 행동 발현
- 전체 75.6% 성공률로 GPT-5.4(70.2%) 및 CaP-Agent0(62.7%)를 능가
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.