BridgeVLA++: A Data-Efficient, Generalizable, and Memory-Augmented Vision-Language-Action Framework for 3D Manipulation
- 발행일
- 출처
- arXiv
- 논문 번호
- 823
- 분야
- Robotics
- arXiv 번호
- 2608.05042
3D 로봇 조작에서 공간 기억과 시간 기억을 추가해 적은 데이터로도 강하고, 기억이 필요한 작업에서도 잘 작동하는 VLA 프레임워크를 만들었다.
이 논문은 한마디로 로봇이 3D 공간에서 물건을 집고 옮길 때 과거 관찰을 기억하고 활용할 수 있게 만든 프레임워크다. BridgeVLA++는 점구름(point cloud)을 2D 이미지로 변환해 VLM(비전-언어 모델)에 넣고, 히트맵을 통해 행동을 예측하는 기존 방식에 공간 기억과 시간 기억을 추가했다. 시간 기억은 작업 단계를 구분하고, 공간 기억은 가려진 부분의 정보를 복원한다. 5개 시뮬레이션 벤치마크에서 최고 성능을 기록했고, 실제 로봇에서도 적은 데이터로 강한 일반화를 보였다.
핵심 요약
- 3D VLA 모델에 시간 기억(작업 순서 기억)과 공간 기억(가려진 물건 위치 기억)을 통합한 최초의 프레임워크다.
- 점구름을 다뷰 이미지로 바꿔 VLM에 넣고 히트맵으로 행동을 예측하는 방식으로 데이터 효율성을 극대화했다.
- 기억 의존 벤치마크(RMBench, MemoryBench)에서 이전 SOTA 대비 평균 20%→93.3%로 획기적 향상을 달성했다.
- 실제 로봇(Franka, Dobot)에서 10회 이내 학습만으로 강한 일반화 성능을 보였고 양팔 조작까지 확장했다.
- 히트맵 중간 표현, 2D 사전학습, 입력 정렬이 성능의 핵심이며 3D 위치 입력은 오히려 성능을 떨어뜨린다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.