QwenLM/Qwen3-TTS

출처
GitHub
처음 오른 날
분야
미디어
GitHub 별 수
13,419
주 언어
Python

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

QwenLM/Qwen3-TTS

무엇을 하나

Alibaba Cloud의 Qwen 팀이 공개한 오픈소스 TTS(텍스트를 음성으로 바꾸는) 모델 시리즈입니다. 스트리밍 음성 생성, 자유로운 목소리 설계, 목소리 복제, 자연어로 하는 음성 제어를 지원합니다.

ATF에 주는 도움

관련이 느슨합니다. ATF Works AI assistant가 답변을 소리 내어 읽어 주는 경우라면 직접 운영하는 음성 출력의 참고가 될 수 있습니다.

라이선스

Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.

같은 분야 저장소

  • ace-step/ACE-Step-1.5
    ACE-Step 1.5는 Mac, AMD, Intel, CUDA 기기에서 로컬로 실행되는 오픈소스 음악 생성 모델입니다. 노래 몇 곡으로 LoRA를 학습해 자기 스타일을 반영할 수 있습니다.
  • NVIDIA/personaplex
    PersonaPlex는 실시간으로 듣고 말하기를 동시에 하는 full-duplex 음성 대화 모델입니다. 텍스트 역할 prompt로 persona를 정하고, 음성 샘플로 목소리를 맞춥니다. Moshi 구조와 가중치를 바탕으로 합니다.
  • dwzhu-pku/PaperBanana
    VLM과 이미지 생성 모델을 이용해 학술 논문용 그림을 만드는 도구입니다. Streamlit 화면에서 사용할 모델을 고를 수 있습니다. Google Research의 PaperVizAgent를 fork한 프로젝트입니다.
  • remotion-dev/remotion
    React 코드로 영상을 만드는 프레임워크이며, 코드가 기준이 됩니다. coding agent로 만들거나, 끌어다 놓기로 편집하거나, 데이터에 연결해 자체 인프라에서 한꺼번에 렌더링할 수 있습니다.
  • jamiepine/voicebox
    짧은 음성 샘플로 목소리를 복제하고, 여러 TTS 엔진으로 음성을 만들고, 단축키로 어떤 입력창에든 받아쓰기를 하는 로컬 AI 음성 스튜디오입니다. MCP를 지원하는 AI agent에 목소리를 줄 수도 있습니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)