FareedKhan-dev/kimi-k3-in-c

来源
GitHub
首次上榜日期
领域
模型推理
GitHub 星标数
8,000
主要语言
C
网站
medium.com/@fareedkhandev/building-kimi-k3-in-c-to-run-a-2-8t-model-on-consumer-hardware-a5792cbf3b59 (在新标签页中打开)

本页介绍外部开源仓库,并非 HDATF 产品。

FareedKhan-dev/kimi-k3-in-c

它做什么

用可移植C99编写的引擎,在单个CPU上运行Kimi K3推理,不需要GPU、BLAS或框架,模型从磁盘流式读取。README称峰值内存为8.24 GB,增加内存只会提升速度。

对 ATF 的帮助

这是在单个CPU上运行大模型的例子,可为在没有GPU的现场开展AX consulting提供些许参考。不过README本身也说明生成速度很慢。

许可证

Apache-2.0 宽松许可,含专利授权。可商用,需保留声明并注明修改。

同领域的其他仓库

  • unslothai/unsloth
    Unsloth是用于运行和训练LLM、扩散、嵌入和音频模型的桌面应用,支持GGUF和MLX格式。本地模型还可与Claude Code、Codex和MCP配合使用,并提供网页搜索和RAG。
  • lyogavin/airllm
    AirLLM通过逐层依次加载模型,降低大语言模型推理所需的GPU显存,无需量化、蒸馏或剪枝即可在单张4GB GPU上运行70B模型,并已加入训练支持。
  • cactus-compute/needle
    Needle 2是一个面向工具调用、设备操作和结构化抽取的45M参数开放模型,整体打包为一个14MB的引擎。其Python包支持推理、LoRA微调和导出,以JSON形式返回工具调用并附带置信度分数。
  • MoonshotAI/Kimi-K3
    Kimi K3是一个开放权重的多模态Mixture-of-Experts模型,总参数2.8T,激活参数104B,支持100万token的context window。它能理解文本、图像和视频,面向长周期编码、知识工作和推理。
  • FlashML-org/FreeToken
    一款serving引擎,把计算分配到GPU、CPU和内存上,在个人硬件上运行大型open-weight MoE模型。它提供兼容Anthropic和OpenAI的API,便于编码agent接入。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)