StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs

발행일
출처
arXiv
논문 번호
899
분야
Computer Vision
arXiv 번호
2608.13416

스트리밍 영상 이해에서 '지금 보기'와 '오래 기억하기'를 구조적으로 분리해 양립시킨 방법. 주목할 메모리 아키텍처.

이 논문은 한마디로 영상을 계속 보며 질문에 답하는 모델에서 실시간 인식과 장기 기억의 트레이드오프를 푼 방법이다. 저자들은 긴 과거를 어텐션 밖의 '빠른 가중치'(영상을 보며 실시간으로 갱신되는 기억 상태)에 저장하고, 어텐션에는 최근 장면만 남겼다. OVO-Bench에서 실시간 인식은 동급 최고 수준(78.9)을 유지하면서 뒤돌아보기 추적은 3.7점 끌어올렸다. 파라미터 절반인데도 8B 모델과 실시간 이해 점수가 0.11점 차였다.

핵심 요약

  • 장기 역사를 어텐션 컨텍스트 밖의 TTT(테스트 타임 트레이닝) 빠른 가중치에 저장해, 과거가 최근 장면 이해를 희석하는 문제를 구조적으로 막았다.
  • 실시간 질의를 답 가능한 시점으로 옮겨 붙인 112.4K 규모 리얼타임 QA 데이터셋을 새로 구축하고 오프라인 장기영상 QA와 함께 학습했다.
  • OVO-Bench에서 SimpleStream-4B 대비 실시간 인식 +1.4점(78.9), 후행 추적 +3.7점(58.3)을 기록했다.
  • StreamingBench RTVU에서 80.48로, 파라미터가 두 배인 SimpleStream-8B(80.59)와 0.11점 차였다.
  • 4K 윈도에서 TTT 상태를 더하면 64K 윈도 확대 효과의 약 97%를 OVO-EPM에서 회복했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)