kyutai-labs/pocket-tts
- 출처
- GitHub
- 처음 오른 날
- 분야
- 미디어
- GitHub 별 수
- 9,539
- 주 언어
- Python
외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

무엇을 하나
GPU 없이 CPU에서 돌아가는 작은 TTS(text-to-speech) 모델로, 오디오 스트리밍, 목소리 복제, Python API와 CLI를 제공합니다. 영어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 스페인어를 지원하고 브라우저에서도 돌릴 수 있습니다.
ATF에 주는 도움
우리 제품과는 느슨하게만 관련됩니다. GPU가 없는 일반 PC에서 음성을 출력하는 방식으로, ATF Works 같은 작업 공간에서 문서를 읽어 주는 경우에 참고할 수 있습니다.
라이선스
MIT 허용 범위가 넓습니다. 저작권 표시를 유지하면 상업적 이용과 수정이 가능합니다.
같은 분야 저장소
- originalankur/maptoposter
도시의 미니멀한 지도 포스터를 만들어 내보내는 Python 스크립트입니다. blueprint, japanese_ink 같은 테마를 고를 수 있습니다. - chatfire-AI/huobao-drama
짧은 드라마 제작을 자동화하는 풀스택 플랫폼입니다. LLM이 대본에서 인물, 장면, 스토리보드를 뽑아냅니다. 이어서 이미지와 영상 모델이 디자인과 장면 클립을 만들고 한 편의 영상으로 합칩니다. - torvalds/AudioNoise
AudioNoise는 디지털 오디오 처리의 기초를 익히려고 만든 phaser, echo 같은 간단한 오디오 효과 모음입니다. IIR 필터와 delay loop를 써서 샘플 하나를 받아 샘플 하나를 내보내는 방식으로 처리합니다. - cjpais/Handy
오프라인으로 동작하는 크로스플랫폼 데스크톱 음성 인식 앱입니다. 단축키를 누른 채 말하거나 눌러서 켜고 끄면, 받아쓴 글이 지금 쓰는 앱에 붙여 넣어집니다. 무음 구간은 Silero VAD로 거르고 받아쓰기는 로컬 Whisper나 Parakeet 모델로 합니다. - remotion-dev/remotion
React 코드로 영상을 만드는 프레임워크이며, 코드가 기준이 됩니다. coding agent로 만들거나, 끌어다 놓기로 편집하거나, 데이터에 연결해 자체 인프라에서 한꺼번에 렌더링할 수 있습니다.
Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.