FareedKhan-dev/kimi-k3-in-c
- 출처
- GitHub
- 처음 오른 날
- 분야
- 모델 추론
- GitHub 별 수
- 8,000
- 주 언어
- C
외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

무엇을 하나
GPU, BLAS, 프레임워크 없이 CPU 하나에서 Kimi K3 추론을 돌리는 이식성 있는 C99 엔진이며, 모델을 디스크에서 읽어 옵니다. README는 최대 메모리 사용량이 8.24 GB이고 RAM을 늘리면 속도만 빨라진다고 적고 있습니다.
ATF에 주는 도움
CPU 하나로 큰 모델을 돌리는 사례라, GPU가 없는 현장의 AX consulting에서 가볍게 참고할 수 있습니다. 다만 README도 생성 속도가 느리다고 적고 있습니다.
라이선스
Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.
같은 분야 저장소
- unslothai/unsloth
Unsloth는 LLM, diffusion, embedding, 오디오 모델을 실행하고 학습시키는 데스크톱 앱이며 GGUF와 MLX 형식을 지원합니다. 로컬 모델을 Claude Code, Codex, MCP와 함께 쓸 수 있고 웹 검색과 RAG도 제공합니다. - lyogavin/airllm
AirLLM은 모델 레이어를 하나씩 차례로 불러와 대형 언어 모델 추론에 필요한 GPU 메모리를 줄입니다. 양자화, 증류, 프루닝 없이 70B 모델을 4GB GPU 한 장에서 돌릴 수 있고, 학습 기능도 추가됐습니다. - cactus-compute/needle
Needle 2는 tool calling, 기기 조작, 구조화된 정보 추출을 위한 45M 파라미터 공개 모델로, 14MB 엔진 하나에 들어갑니다. Python 패키지는 추론, LoRA fine-tuning, 내보내기를 지원하며, tool 호출을 신뢰도 점수와 함께 JSON으로 돌려줍니다. - MoonshotAI/Kimi-K3
Kimi K3는 전체 파라미터 2.8T, 활성 파라미터 104B인 open-weight 멀티모달 Mixture-of-Experts 모델이며, 1백만 token context window를 지원합니다. 텍스트, 이미지, 영상을 이해하고, 긴 시간이 걸리는 coding, 지식 업무, 추론을 목표로 합니다. - FlashML-org/FreeToken
GPU, CPU, 메모리에 작업을 나눠 대형 open-weight MoE 모델을 개인 하드웨어에서 돌리는 serving 엔진입니다. 코딩 agent가 연결할 수 있도록 Anthropic, OpenAI 호환 API를 제공합니다.
Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.