Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

발행일
출처
arXiv
논문 번호
492
분야
Computer Vision
arXiv 번호
2606.25041

Wan-Streamer는 실시간 저지연 오디오-비주얼 완전 중복 상호작용을 위한 네이티브 스트리밍 엔드투엔드 파운데이션 모델이다.

Wan-Streamer는 언어, 오디오, 비디오를 입력과 출력 모두에서 하나의 트랜스포머로 모델링하고 블록-인과성 주의를 사용하여 증분 스트리밍을 지원한다. 별도의 VAD, ASR, 언어 모델, TTS, 아바타, 비디오 생성 모듈에 의존하지 않고 인지, 추론, 생성, 응답 타이밍, 턴 관리, 크로스모달 동기화를 통합 모델에서 공동 학습한다. 모델 측 응답 지연 약 200ms, 전체 상호작용 지연 약 550ms를 달성한다.

핵심 요약

  • Wan-Streamer는 언어, 오디오, 비디오를 입력과 출력 모두에서 하나의 트랜스포머로 모델링하고 블록-인과성 주의를 사용하여 증분 스트리밍을 지원한다
  • 별도의 VAD, ASR, 언어 모델, TTS, 아바타, 비디오 생성 모듈에 의존하지 않고 인지, 추론, 생성, 응답 타이밍, 턴 관리, 크로스모달 동기화를 통합 모델에서 공동 학습한다

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)