jamiepine/voicebox

출처
GitHub
처음 오른 날
분야
미디어
GitHub 별 수
55,114
주 언어
TypeScript
웹사이트
voicebox.sh (새 탭에서 열림)

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

jamiepine/voicebox

무엇을 하나

짧은 음성 샘플로 목소리를 복제하고, 여러 TTS 엔진으로 음성을 만들고, 단축키로 어떤 입력창에든 받아쓰기를 하는 로컬 AI 음성 스튜디오입니다. MCP를 지원하는 AI agent에 목소리를 줄 수도 있습니다.

ATF에 주는 도움

우리 제품과는 관련이 없습니다. 순위 목록에 올라 함께 적었습니다.

라이선스

MIT 허용 범위가 넓습니다. 저작권 표시를 유지하면 상업적 이용과 수정이 가능합니다.

같은 분야 저장소

  • waooAI/waoowaoo
    이미지와 영상을 만드는 AI 작업 공간입니다. assistant와 함께 기획안을 다듬고, 참고 자료를 올리고, 캔버스에서 결과물을 생성하고 고칩니다. 결과를 새 버전으로 고쳐도 원본은 남습니다.
  • dwzhu-pku/PaperBanana
    VLM과 이미지 생성 모델을 이용해 학술 논문용 그림을 만드는 도구입니다. Streamlit 화면에서 사용할 모델을 고를 수 있습니다. Google Research의 PaperVizAgent를 fork한 프로젝트입니다.
  • nikopueringer/CorridorKey
    CorridorKey는 그린 스크린 키잉용 신경망입니다. 원본 그린 스크린 프레임에서 픽셀마다 전경 색과 깨끗한 선형 알파 채널을 예측합니다. 반투명한 가장자리와 모션 블러도 포함합니다.
  • ace-step/ACE-Step-1.5
    ACE-Step 1.5는 Mac, AMD, Intel, CUDA 기기에서 로컬로 실행되는 오픈소스 음악 생성 모델입니다. 노래 몇 곡으로 LoRA를 학습해 자기 스타일을 반영할 수 있습니다.
  • hacksider/Deep-Live-Cam
    Deep-Live-Cam은 이미지 한 장으로 실시간 얼굴 바꾸기와 영상 deepfake를 만드는 도구입니다. 노출이나 잔혹한 장면 같은 부적절한 미디어를 막기 위한 검사 기능이 들어 있습니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)