GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 1014
- 분야
- Robotics
- arXiv 번호
- 2608.24714
이 논문은 로봇 조작용 월드-액션 모델에 3D 가우시안 장을 '학습 시간 전용 교사'로 붙여 기하·의미 감각을 주입하고, 추론 때는 전부 떼어내 원래 속도를 유지한 채 성공률을 크게 올렸다.
이 논문은 한마디로 로봇 팔 조작용 월드-액션 모델(미래 영상을 예측하며 동작을 만드는 모델, WAM)의 내부 표현에 3D 공간 감각과 사물 의미를 주입하는 학습법이다. 여러 시점의 영상에서 깊이·의미 정보를 뽑아 3D 가우시안 장(공간을 작은 타원체 모음으로 표현하는 방식)에 묶은 뒤, 그걸 다시 WAM 표현에 증류(교사 모델에서 지식을 옮겨 주는 학습)해 넣는다. 교사 모델과 가우시안 장은 학습에만 쓰고 추론 때는 전부 제거하므로 배포 구조와 계산 비용은 그대로다. 그 결과 LIBERO-Plus 벤치마크에서 FastWAM을 52.05%에서 71.29%로, Cosmos Policy를 71.52%에서 77.30%로 올렸고 실제 양팔 로봇에서도 평균 성공률 30%에서 40%로 올랐다.
핵심 요약
- 미래 영상 예측만 하던 WAM 표현에 3D 가우시안 장을 매개로 깊이·의미·커버리지 감독을 공간적으로 정렬해 넣었다.
- 학습에만 쓰는 교사라 추론 파이프라인과 계산 비용이 그대로여서 실서비스 부담 없이 쓸 수 있다.
- LIBERO-Plus에서 FastWAM 52.05%→71.29%, Cosmos Policy 71.52%→77.30%로 올렸다.
- 교사 신호를 가우시안 장으로 통합한 게 효과가 있었다. 그냥 직접 증류(69.37%)보다 1.9점 더 높았다.
- 실제 양팔 로봇(UR7e 두 대) 실험에서도 평균 성공률을 30.00%에서 40.00%로 올렸다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.