kyutai-labs/pocket-tts

출처
GitHub
처음 오른 날
분야
미디어
GitHub 별 수
9,539
주 언어
Python

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

kyutai-labs/pocket-tts

무엇을 하나

GPU 없이 CPU에서 돌아가는 작은 TTS(text-to-speech) 모델로, 오디오 스트리밍, 목소리 복제, Python API와 CLI를 제공합니다. 영어, 프랑스어, 독일어, 포르투갈어, 이탈리아어, 스페인어를 지원하고 브라우저에서도 돌릴 수 있습니다.

ATF에 주는 도움

우리 제품과는 느슨하게만 관련됩니다. GPU가 없는 일반 PC에서 음성을 출력하는 방식으로, ATF Works 같은 작업 공간에서 문서를 읽어 주는 경우에 참고할 수 있습니다.

라이선스

MIT 허용 범위가 넓습니다. 저작권 표시를 유지하면 상업적 이용과 수정이 가능합니다.

같은 분야 저장소

  • originalankur/maptoposter
    도시의 미니멀한 지도 포스터를 만들어 내보내는 Python 스크립트입니다. blueprint, japanese_ink 같은 테마를 고를 수 있습니다.
  • chatfire-AI/huobao-drama
    짧은 드라마 제작을 자동화하는 풀스택 플랫폼입니다. LLM이 대본에서 인물, 장면, 스토리보드를 뽑아냅니다. 이어서 이미지와 영상 모델이 디자인과 장면 클립을 만들고 한 편의 영상으로 합칩니다.
  • torvalds/AudioNoise
    AudioNoise는 디지털 오디오 처리의 기초를 익히려고 만든 phaser, echo 같은 간단한 오디오 효과 모음입니다. IIR 필터와 delay loop를 써서 샘플 하나를 받아 샘플 하나를 내보내는 방식으로 처리합니다.
  • cjpais/Handy
    오프라인으로 동작하는 크로스플랫폼 데스크톱 음성 인식 앱입니다. 단축키를 누른 채 말하거나 눌러서 켜고 끄면, 받아쓴 글이 지금 쓰는 앱에 붙여 넣어집니다. 무음 구간은 Silero VAD로 거르고 받아쓰기는 로컬 Whisper나 Parakeet 모델로 합니다.
  • remotion-dev/remotion
    React 코드로 영상을 만드는 프레임워크이며, 코드가 기준이 됩니다. coding agent로 만들거나, 끌어다 놓기로 편집하거나, 데이터에 연결해 자체 인프라에서 한꺼번에 렌더링할 수 있습니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)