dwzhu-pku/PaperBanana
- 출처
- GitHub
- 처음 오른 날
- 분야
- 미디어
- GitHub 별 수
- 7,093
- 주 언어
- Python
외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.
무엇을 하나
VLM과 이미지 생성 모델을 이용해 학술 논문용 그림을 만드는 도구입니다. Streamlit 화면에서 사용할 모델을 고를 수 있습니다. Google Research의 PaperVizAgent를 fork한 프로젝트입니다.
ATF에 주는 도움
LabChin에서 최종 연구 보고서에 그림이 필요할 때 참고할 수 있습니다. 주 모델과 이미지 모델을 따로 고르는 구성도 비교해 볼 만합니다.
라이선스
Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.
같은 분야 저장소
- jamiepine/voicebox
짧은 음성 샘플로 목소리를 복제하고, 여러 TTS 엔진으로 음성을 만들고, 단축키로 어떤 입력창에든 받아쓰기를 하는 로컬 AI 음성 스튜디오입니다. MCP를 지원하는 AI agent에 목소리를 줄 수도 있습니다. - ace-step/ACE-Step-1.5
ACE-Step 1.5는 Mac, AMD, Intel, CUDA 기기에서 로컬로 실행되는 오픈소스 음악 생성 모델입니다. 노래 몇 곡으로 LoRA를 학습해 자기 스타일을 반영할 수 있습니다. - waooAI/waoowaoo
이미지와 영상을 만드는 AI 작업 공간입니다. assistant와 함께 기획안을 다듬고, 참고 자료를 올리고, 캔버스에서 결과물을 생성하고 고칩니다. 결과를 새 버전으로 고쳐도 원본은 남습니다. - QwenLM/Qwen3-TTS
Alibaba Cloud의 Qwen 팀이 공개한 오픈소스 TTS(텍스트를 음성으로 바꾸는) 모델 시리즈입니다. 스트리밍 음성 생성, 자유로운 목소리 설계, 목소리 복제, 자연어로 하는 음성 제어를 지원합니다. - nikopueringer/CorridorKey
CorridorKey는 그린 스크린 키잉용 신경망입니다. 원본 그린 스크린 프레임에서 픽셀마다 전경 색과 깨끗한 선형 알파 채널을 예측합니다. 반투명한 가장자리와 모션 블러도 포함합니다.
Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.