microsoft/VibeVoice
- 출처
- GitHub
- 처음 오른 날
- 분야
- 미디어
- GitHub 별 수
- 54,353
- 주 언어
- Python
외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

무엇을 하나
VibeVoice는 오픈소스 음성 AI 프로젝트입니다. 음성 인식 모델은 60분 길이의 오디오를 한 번에 처리해 화자와 timestamp가 붙은 텍스트로 옮기며, streaming 버전은 말이 들어오는 대로 받아 적습니다.
ATF에 주는 도움
전사 결과에 누가 언제 말했는지가 표시되므로, ATF Works에서 회의 녹음을 업무 기록으로 바꾸는 데 참고할 수 있습니다.
라이선스
MIT 허용 범위가 넓습니다. 저작권 표시를 유지하면 상업적 이용과 수정이 가능합니다.
같은 분야 저장소
- siddharthvaddem/openscreen
OpenScreen은 제품 데모와 사용 안내 영상을 만드는 오픈소스 화면 녹화 도구입니다. 창이나 전체 화면 녹화, 마이크와 시스템 오디오, 웹캠 오버레이, 자동 또는 수동 확대, 커서 효과, 기기 안에서 만드는 자막을 지원합니다. 지금은 archived 상태입니다. - tiajinsha/JKVideo
JKVideo는 React Native로 만든 서드파티 Bilibili 클라이언트로, DASH 영상 재생, 탄막, 라이브 방송, 다운로드를 지원합니다. Bilibili로부터 변호사 서한을 받은 뒤 유지보수를 멈췄습니다. - OpenBMB/VoxCPM
VoxCPM은 tokenizer 없이 음성을 만드는 TTS 시스템입니다. VoxCPM2는 2B 파라미터 모델로 30개 언어, 텍스트 설명으로 새 목소리 만들기, 짧은 음성으로 조절 가능한 음성 복제, 48kHz 오디오 출력을 지원합니다. - hacksider/Deep-Live-Cam
Deep-Live-Cam은 이미지 한 장으로 실시간 얼굴 바꾸기와 영상 deepfake를 만드는 도구입니다. 노출이나 잔혹한 장면 같은 부적절한 미디어를 막기 위한 검사 기능이 들어 있습니다. - heygen-com/hyperframes
HyperFrames는 HTML, CSS, 미디어, 원하는 시점으로 이동할 수 있는 애니메이션을 결과가 항상 같은 MP4 영상으로 만듭니다. CLI로 쓰거나, 기획, HTML 작성, lint, 미리보기, 렌더링 과정을 담은 skill을 통해 AI coding agent에서 쓸 수 있습니다.
Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.