lyogavin/airllm

出典
GitHub
初登場日
分野
モデル推論
GitHubスター数
34,422
主な言語
Jupyter Notebook

外部のオープンソース リポジトリを紹介するページです。HDATFの製品ではありません。

lyogavin/airllm

何をするか

AirLLMはモデルのレイヤーを1つずつ順に読み込むことで、大規模言語モデルの推論に必要なGPUメモリを減らします。量子化、蒸留、プルーニングなしで70Bモデルを4GBのGPU 1枚で動かせ、学習機能も追加されました。

ATFへの役立ち方

顧客の現場が手持ちの小さなGPUでオープンモデルを動かしたい場合に、AX consultingで比較する価値があります。速度や実際の業務への適合性は別途確認が必要です。

ライセンス

Apache-2.0 寛容で特許許諾を含みます。商用利用できます。告知を残し、変更点を明記します。

同じ分野のリポジトリ

  • FareedKhan-dev/kimi-k3-in-c
    GPU、BLAS、フレームワークなしで、1つのCPU上でKimi K3の推論を動かす移植性のあるC99エンジンで、モデルをディスクから読み込みます。READMEでは、ピークメモリ使用量が8.24 GBで、RAMを増やすと速度だけが上がると書かれています。
  • MoonshotAI/Kimi-K3
    Kimi K3は、総パラメータ2.8T、活性パラメータ104Bのopen-weightマルチモーダルMixture-of-Expertsモデルで、100万tokenのcontext windowに対応します。テキスト、画像、動画を理解し、長時間にわたるcoding、知識業務、推論を対象としています。
  • unslothai/unsloth
    Unslothは、LLM、拡散、埋め込み、音声モデルを実行し学習させるデスクトップアプリで、GGUFとMLX形式に対応します。ローカルモデルをClaude Code、Codex、MCPと組み合わせて使え、ウェブ検索とRAGも備えます。
  • drumih/turbo-fieldfare
    Apple Silicon Mac上で、Gemma 4 26B-A4Bモデルを約2 GBのRAMで動かすSwiftとMetalのruntimeです。共有コアとKV cacheだけをメモリに置き、必要なexpertだけをSSDからストリーミングします。
  • cactus-compute/needle
    Needle 2は、tool calling、デバイス操作、構造化抽出のための45Mパラメータの公開モデルで、14MBの単一エンジンに収まっています。Pythonパッケージは推論、LoRAファインチューニング、エクスポートを扱い、tool呼び出しを信頼度スコア付きのJSONで返します。

Trendshiftのランキングに入ったリポジトリだけを載せ、リストは候補を探すためだけに使いました。順位の数字は転載していません。説明、ライセンス、スター数は各GitHubリポジトリで確認しました。解説は私たちの判断です。これらを試験したわけではなく、上昇リストに載ったことは品質の証明ではありません。

GitHubで見る (新しいタブで開きます)