StreamTTT: Reconciling Real-Time Perception and Long-Term Memory in Streaming VLMs
- 발행일
- 출처
- arXiv
- 논문 번호
- 899
- 분야
- Computer Vision
- arXiv 번호
- 2608.13416
스트리밍 영상 이해에서 '지금 보기'와 '오래 기억하기'를 구조적으로 분리해 양립시킨 방법. 주목할 메모리 아키텍처.
이 논문은 한마디로 영상을 계속 보며 질문에 답하는 모델에서 실시간 인식과 장기 기억의 트레이드오프를 푼 방법이다. 저자들은 긴 과거를 어텐션 밖의 '빠른 가중치'(영상을 보며 실시간으로 갱신되는 기억 상태)에 저장하고, 어텐션에는 최근 장면만 남겼다. OVO-Bench에서 실시간 인식은 동급 최고 수준(78.9)을 유지하면서 뒤돌아보기 추적은 3.7점 끌어올렸다. 파라미터 절반인데도 8B 모델과 실시간 이해 점수가 0.11점 차였다.
핵심 요약
- 장기 역사를 어텐션 컨텍스트 밖의 TTT(테스트 타임 트레이닝) 빠른 가중치에 저장해, 과거가 최근 장면 이해를 희석하는 문제를 구조적으로 막았다.
- 실시간 질의를 답 가능한 시점으로 옮겨 붙인 112.4K 규모 리얼타임 QA 데이터셋을 새로 구축하고 오프라인 장기영상 QA와 함께 학습했다.
- OVO-Bench에서 SimpleStream-4B 대비 실시간 인식 +1.4점(78.9), 후행 추적 +3.7점(58.3)을 기록했다.
- StreamingBench RTVU에서 80.48로, 파라미터가 두 배인 SimpleStream-8B(80.59)와 0.11점 차였다.
- 4K 윈도에서 TTT 상태를 더하면 64K 윈도 확대 효과의 약 97%를 OVO-EPM에서 회복했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.