Track4Action: Distilling World-Centric 3D Tracker into Vision-Language-Action Policies
- 발행일
- 출처
- arXiv
- 논문 번호
- 817
- 분야
- Robotics
- arXiv 번호
- 2608.03727
이 논문은 3D 추적 모델의 특징을 VLA 정책에 증류해서 로봇이 추적 모델 없이도 3D 공간 이해 능력을 갖게 하는 Track4Action을 제안했다.
이 논문은 한마디로 로봇 정책(VLA)에 3D 추적 모델의 지식을 학습시켜서, 실제 배포 때는 추적 모델 없이도 공간 변화를 이해하게 만들었다. 학습 때만 동작하는 3D 추적 선생 모델에서 키프레임 간 공간 변화 특징을 뽑아 학생 정책에 증류한다. LIBERO-Plus 제로샷 82.3%, 실제 양팔 로봇 67.5%를 달성했다.
핵심 요약
- 학습 때만 3D 추적 모델을 사용하고 배포 때는 제거하는 프리빌리지드 슈퍼비전 방식을 제안했다.
- Track4World에서 뽑은 3D 트래커 특징을 track query가 매칭해서 VLA 행동 헤드에 주입한다.
- LIBERO-Plus 제로샷 82.3%로 정렬 없는 버전 대비 +7.6%p, LaMP 대비 +3.0%p 향상했다.
- RoboTwin 2.0 clean/randomized 각각 80.44%, 81.48%를 기록했다.
- 실제 양팔 로봇 4개 태스크에서 67.5%로 정렬 없는 버전 대비 +25.0%p를 달성했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.