IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer
- 발행일
- 출처
- arXiv
- 논문 번호
- 689
- 분야
- Computer Vision
- arXiv 번호
- 2607.19228
비디오 스트림에서 3D 기하학과 객체 식별을 동시에 실시간으로 처리하는 스트리밍 트랜스포머.
이 논문은 한마디로 연속되는 비디오 프레임에서 3D 기하학(깊이, 포즈)과 객체 정체성(인스턴스)을 동시에 온라인으로 예측하는 트랜스포머다. 기존 스트리밍 3D 모델은 기하학만 다루고 객체 식별은 빠져 있었는데, IGGT4D는 인스턴스 특징을 기하학과 함께 예측해서 물체가 사라졌다 나타나도 같은 객체로 인식한다. 14.7만 장면의 4D 인스턴스 주석 데이터셋(InsScene4D-147K)도 새로 구축했다. 3D 재구성, 포즈 추정, 객체 추적, 열린 어휘 분할에서 기존 스트리밍 방법을 모두 능가했다.
핵심 요약
- 비디오 스트림에서 기하학과 인스턴스 정체성을 동시에 예측하는 최초의 스트리밍 트랜스포머다.
- 인과적 마스킹으로 프레임을 순차 처리하며, 과거 컨텍스트를 KV 캐시로 재사용한다.
- 14.7만 장면의 4D 인스턴스 주석 데이터셋 InsScene4D-147K를 구축했다.
- 객체 추적에서 기존 대비 월등한 성능(T-mIoU 58.84 vs SAM2 45.38)을 보였다.
- 스트리밍 클러스터링이 프레임 수와 무관하게 일정한 메모리(0.7GB)를 유지한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.