Video = World + Event Stream

발행일
출처
arXiv
논문 번호
642
분야
Computer Vision
arXiv 번호
2607.15038

비디오를 '세계 + 사건 스트림'으로 분해해 실시간 오디오-비주얼 상호작용을 하는 범용 사전학습 프레임워크.

이 논문은 한마디로 비디오를 '세계(고정 맥락)'와 '사건 스트림(변화)'으로 쪼개서 학습하는 실시간 스트리밍 모델이다. 세계는 배경·캐릭터·음향 등 안정적인 정보이고, 사건은 말하기·행동·움직임 등 변화다. 이 분해로 대량의 일반 비디오에서 사전학습한 뒤, 실시간 대화 에이전트로 전환한다. 640x368 화질, 25FPS, ~200ms 응답 지연을 유지한다.

핵심 요약

  • 비디오 = 세계(고정 맥락) + 사건 스트림(변화)이라는 분해를 제안해 범용 사전학습 과제를 정의했다.
  • 사건 스트림에 자유 형식 행동(괄호 안 자연어 지시)을 추가해 에이전트가 제한된 액션 셋이 아닌 open-vocabulary 행동을 하게 했다.
  • 200ms 모델 응답 지연, 550ms 전체 상호작용 지연으로 실시간 전이중 오디오-비주얼 대화를 유지한다.
  • 사전학습→다운스트림 전환의 유연성을 보여주며, 같은 스트리밍 로직으로 다양한 실시간 과제에 적응 가능함을 시사한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)