Video = World + Event Stream
- 발행일
- 출처
- arXiv
- 논문 번호
- 642
- 분야
- Computer Vision
- arXiv 번호
- 2607.15038
비디오를 '세계 + 사건 스트림'으로 분해해 실시간 오디오-비주얼 상호작용을 하는 범용 사전학습 프레임워크.
이 논문은 한마디로 비디오를 '세계(고정 맥락)'와 '사건 스트림(변화)'으로 쪼개서 학습하는 실시간 스트리밍 모델이다. 세계는 배경·캐릭터·음향 등 안정적인 정보이고, 사건은 말하기·행동·움직임 등 변화다. 이 분해로 대량의 일반 비디오에서 사전학습한 뒤, 실시간 대화 에이전트로 전환한다. 640x368 화질, 25FPS, ~200ms 응답 지연을 유지한다.
핵심 요약
- 비디오 = 세계(고정 맥락) + 사건 스트림(변화)이라는 분해를 제안해 범용 사전학습 과제를 정의했다.
- 사건 스트림에 자유 형식 행동(괄호 안 자연어 지시)을 추가해 에이전트가 제한된 액션 셋이 아닌 open-vocabulary 행동을 하게 했다.
- 200ms 모델 응답 지연, 550ms 전체 상호작용 지연으로 실시간 전이중 오디오-비주얼 대화를 유지한다.
- 사전학습→다운스트림 전환의 유연성을 보여주며, 같은 스트리밍 로직으로 다양한 실시간 과제에 적응 가능함을 시사한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.