debpalash/VoiceStudio
- 출처
- GitHub
- 처음 오른 날
- 분야
- 미디어
- GitHub 별 수
- 44,111
- 주 언어
- Python
외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

무엇을 하나
VoiceStudio는 로컬에서 돌아가는 오픈소스 앱으로, 음성 복제, 음성 디자인, 영상 더빙, 받아쓰기, 전사, 오디오북 제작을 646개 언어로 지원합니다. agent를 위한 로컬 API와 MCP도 제공합니다.
ATF에 주는 도움
받아쓰기와 전사 기능은 ATF Works의 일일 업무일지를 음성으로 남기는 방법에 참고할 수 있습니다. 음성 복제와 더빙 기능은 우리 제품 범위 밖입니다.
라이선스
AGPL-3.0 네트워크 카피레프트입니다. 수정본을 서비스로 제공해도 소스를 공개해야 합니다. 제품에 쓰기 전에 검토가 필요합니다.
같은 분야 저장소
- crmne/spotifast
Spotifast는 Rust와 egui로 만든 네이티브 Spotify 클라이언트로, librespot으로 음악을 재생하고 Spotify Connect 기기로 표시됩니다. Linux, macOS, Windows에서 돌아가며 재생에는 Spotify Premium이 필요합니다. - LiamGvchi/gc-minimal-zine-poster
GC Minimal Zine Poster는 주제, 문장, 사물, 분위기, 사진을 여백이 많은 종이 질감의 편집 포스터나 이미지 prompt, 다시 쓸 수 있는 시각 체계로 바꿔 주는 Codex skill입니다. - webadderallorg/Recordly
데모와 사용 안내 영상을 위해 화면을 녹화하고 편집하는 데스크톱 앱입니다. 자동 확대, 부드러운 커서 움직임, 웹캠 오버레이, 꾸민 프레임, 타임라인 편집을 제공합니다. - huggingface/speech-to-speech
음성 구간 감지, 음성 인식, 언어 모델, 음성 합성을 차례로 잇는 모듈형 voice agent pipeline입니다. OpenAI Realtime 이벤트를 WebSocket과 WebRTC로 제공하고, 로컬에서 돌리는 LLM을 포함해 모든 구성 요소를 바꿀 수 있습니다. - k2-fsa/OmniVoice
600개가 넘는 언어를 지원하는 zero-shot TTS(text-to-speech) 모델입니다. 목소리 복제, 성별, 나이, 억양 같은 화자 속성으로 목소리 만들기, 발음 교정을 지원하며 Python API와 CLI를 제공합니다.
Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.