OpenBMB/VoxCPM

출처
GitHub
처음 오른 날
분야
미디어
GitHub 별 수
37,682
주 언어
Python
웹사이트
voxcpm.com (새 탭에서 열림)

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

OpenBMB/VoxCPM

무엇을 하나

VoxCPM은 tokenizer 없이 음성을 만드는 TTS 시스템입니다. VoxCPM2는 2B 파라미터 모델로 30개 언어, 텍스트 설명으로 새 목소리 만들기, 짧은 음성으로 조절 가능한 음성 복제, 48kHz 오디오 출력을 지원합니다.

ATF에 주는 도움

우리 제품과는 관련이 없습니다. 순위 목록에 올라 함께 적었습니다.

라이선스

Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.

같은 분야 저장소

  • heygen-com/hyperframes
    HyperFrames는 HTML, CSS, 미디어, 원하는 시점으로 이동할 수 있는 애니메이션을 결과가 항상 같은 MP4 영상으로 만듭니다. CLI로 쓰거나, 기획, HTML 작성, lint, 미리보기, 렌더링 과정을 담은 skill을 통해 AI coding agent에서 쓸 수 있습니다.
  • siddharthvaddem/openscreen
    OpenScreen은 제품 데모와 사용 안내 영상을 만드는 오픈소스 화면 녹화 도구입니다. 창이나 전체 화면 녹화, 마이크와 시스템 오디오, 웹캠 오버레이, 자동 또는 수동 확대, 커서 효과, 기기 안에서 만드는 자막을 지원합니다. 지금은 archived 상태입니다.
  • Anil-matcha/Open-Generative-AI
    Flux, Kling, Sora, Veo 등 여러 모델로 AI 이미지와 영상을 만드는 self-hosted 스튜디오입니다. 콘텐츠 필터가 없다고 밝히고 있습니다. 라이선스는 MIT입니다.
  • microsoft/VibeVoice
    VibeVoice는 오픈소스 음성 AI 프로젝트입니다. 음성 인식 모델은 60분 길이의 오디오를 한 번에 처리해 화자와 timestamp가 붙은 텍스트로 옮기며, streaming 버전은 말이 들어오는 대로 받아 적습니다.
  • EvoLinkAI/awesome-gpt-image-2-API-and-Prompts
    GPT-Image-2 API와 prompt를 다루는 저장소입니다. README 내용이 없어 더 자세한 설명은 적지 않았습니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)