SpatialBench: Is Your Spatial Foundation Model an All-Round Player?
- 발행일
- 출처
- arXiv
- 논문 번호
- 259
- 분야
- Computer Vision
- arXiv 번호
- 2605.27367
포괄적 벤치마크인 SpatialBench는 다양한 작업, 도메인, 입력 밀도에 걸쳐 공간 파운데이션 모델(SFM)을 평가한다.
SpatialBench는 공간 파운데이션 모델을 특정 데이터셋 하나가 아니라 과제, 장면 영역, 입력 프레임 밀도, 계산 방식 전반에서 비교하는 벤치마크다. 5개 공간 영역의 19개 데이터셋과 546개 장면을 모아 6개 구조 계열의 41개 모델을 5개 과제 묶음과 4개 입력 밀도에서 결정론적으로 평가한다. 결과는 현재 모델이 모든 조건에 강한 범용 모델은 아니며, 전체 문맥 주의는 정확도에 유리한 반면 제한 메모리 방식은 긴 영상의 확장성에 유리함을 보여준다. 체화·1인칭 과제에서는 단순한 데이터 양보다 목표 영역과의 일치와 데이터 품질이 더 중요했다. 연구진은 특히 부족했던 1인칭·손목 시점 자료를 보완하기 위해 DA-Next-5M 데이터셋과 DA-Next 기준 모델도 함께 공개했다.
핵심 요약
- DENSE: 장기 시계열 비디오 시퀀스에 초점을 맞추며, 최대 500프레임 한계까지 거의 모든 프레임을 입력한다.
- 로보틱스용: DA-Next-5M 또는 유사한 1인칭 시점 데이터셋으로 학습된 모델을 사용한다. 표준 실내/실외 파운데이션 모델은 손목 장착형 조작 작업에서 실패할 가능성이 높다.
- AR/VR용: 온라인 스트리밍 또는 청크 기반 모델이 선호된다. 이러한 시스템은 모바일 기기나 헤드셋의 메모리 한계를 초과하지 않으면서 긴 세션을 처리해야 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.