deepseek-ai/DeepGEMM

来源
GitHub
首次上榜日期
领域
模型推理
GitHub 星标数
8,159
主要语言
Cuda

本页介绍外部开源仓库,并非 HDATF 产品。

deepseek-ai/DeepGEMM

它做什么

面向语言模型计算的CUDA张量核心内核库,包括矩阵乘法和融合MoE。通过DeepJIT在运行时编译内核。

对 ATF 的帮助

LabChin规划语言模型的GPU计算实验时,可以参考其内核实现。它是底层库,而非研究笔记或工作流程工具。

许可证

MIT 宽松许可。保留版权声明即可商用和修改。

同领域的其他仓库

  • Ebony-Vinyl/dsh-our-free-model
    这是把dsh智能体连接到外部模型服务的插件,并不在本地运行模型权重。它把对话、工具结果和可选图像发送到上游网关,接收回答或工具调用。适配器会刷新模型目录、探测可用性,并把多种响应协议转换为宿主的流式格式。它还提供供其他程序调用的OpenAI兼容本地转发服务和本地用量记录。开始使用需要兼容的dsh宿主、受支持的Node.js运行环境和网络连接。Kilo官方允许匿名调用免费模型,但会按IP限制请求次数。OpenCode路径还会模拟客户端识别信息,因此不能把所有路径都视为官方支持的公共API,需要单独审查授权和服务条款。其他账号渠道和桌面EAC渠道需要各自的登录或授权,免费网关也不能被视为无限量、私有或适合敏感生产数据的服务。
  • Edge0-AI/Edge0
    Edge0是使用SSD专家卸载、Recover-LoRA和路由预测的流式MoE推理框架。README区分了已发布的平台引擎与计划于2026年第四季度推出的统一框架。
  • Vibra-Ingenn/Janus
    这是一个单一的Go可执行文件,在本机运行gguf模型,通过llama.cpp使用AMD、Intel、NVIDIA显卡的Vulkan,并可回退到CPU,同时提供与OpenAI兼容的API,包括chat completions和models。它支持不重启热切换模型、把推理内容拆分到单独字段,并从gguf元数据读取chat template,无需Python和Docker。
  • magnitudedev/magnitude
    这是在用户硬件上编译和调优内核的智能体推理引擎。它在Apple Silicon、NVIDIA、AMD或CPU上运行开放模型,并通过桌面应用和CLI连接现有智能体。
  • ProjectDMX/DMI
    这是用于查看LLM推理和训练内部状态的解耦异步观测后端。它处于研究预览阶段,提供HuggingFace、vLLM和Megatron-LM集成,API可能变化。

只收录进入 Trendshift 排行榜的仓库,榜单仅用于寻找候选项目,不转载名次。说明、许可证和星标数来自各 GitHub 仓库。解读是我们自己的判断。我们尚未测试这些项目,上榜并不证明质量。

在 GitHub 上查看 (在新标签页中打开)