Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 492
- 분야
- Computer Vision
- arXiv 번호
- 2606.25041
Wan-Streamer는 실시간 저지연 오디오-비주얼 완전 중복 상호작용을 위한 네이티브 스트리밍 엔드투엔드 파운데이션 모델이다.
Wan-Streamer는 언어, 오디오, 비디오를 입력과 출력 모두에서 하나의 트랜스포머로 모델링하고 블록-인과성 주의를 사용하여 증분 스트리밍을 지원한다. 별도의 VAD, ASR, 언어 모델, TTS, 아바타, 비디오 생성 모듈에 의존하지 않고 인지, 추론, 생성, 응답 타이밍, 턴 관리, 크로스모달 동기화를 통합 모델에서 공동 학습한다. 모델 측 응답 지연 약 200ms, 전체 상호작용 지연 약 550ms를 달성한다.
핵심 요약
- Wan-Streamer는 언어, 오디오, 비디오를 입력과 출력 모두에서 하나의 트랜스포머로 모델링하고 블록-인과성 주의를 사용하여 증분 스트리밍을 지원한다
- 별도의 VAD, ASR, 언어 모델, TTS, 아바타, 비디오 생성 모듈에 의존하지 않고 인지, 추론, 생성, 응답 타이밍, 턴 관리, 크로스모달 동기화를 통합 모델에서 공동 학습한다
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.