Cambrian-P: Pose-Grounded Video Understanding

발행일
출처
arXiv
논문 번호
197
분야
Computer Vision
arXiv 번호
2605.22819

Cambrian-P라는 모델은 명시적 카메라 포즈 그라운딩을 통해 비디오 이해를 위한 멀티모달 대규모 언어 모델을 보강해 공간 추론의 한계를 해결한다.

비디오용 멀티모달 언어 모델은 보통 프레임을 독립된 이차원 장면처럼 처리해 카메라 위치와 방향이 만드는 공통 공간 좌표를 충분히 쓰지 않는다. Cambrian-P는 프레임마다 학습 가능한 카메라 토큰과 포즈 회귀 헤드를 넣어 비디오 이해를 카메라 움직임에 연결한다. 설계된 샘플링 방식과 함께 학습했을 때 VSI-Bench 같은 공간 추론 평가에서 4.5퍼센트에서 6.5퍼센트의 향상을 보였다. 추가 여덟 개 공간 및 일반 비디오 질의응답 평가로 일반화했고 ScanNet의 스트리밍 포즈 추정에서도 최고 수준의 결과를 냈다. 실제 영상에 자동 생성한 포즈 주석을 더한 학습이 일반 비디오 질의응답까지 개선해 카메라 포즈가 공간 문제 밖에서도 유용한 감독 신호임을 보여준다.

핵심 요약

  • 주석: 기성 포즈 추정기인 ViPE를 사용해 나머지 클립에 대한 외부·내부 카메라 파라미터를 생성한다.
  • 모델 크기: LLM 크기가 0.5B에서 7B 파라미터로 커질수록 VQA 성능과 포즈 정확도가 일관되게 향상되었다.
  • 데이터 크기: 학습 데이터의 양을 늘릴수록 포즈 그라운딩 모델과 베이스라인 간의 성능 격차가 벌어졌다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)