lyogavin/airllm

출처
GitHub
처음 오른 날
분야
모델 추론
GitHub 별 수
34,422
주 언어
Jupyter Notebook

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

lyogavin/airllm

무엇을 하나

AirLLM은 모델 레이어를 하나씩 차례로 불러와 대형 언어 모델 추론에 필요한 GPU 메모리를 줄입니다. 양자화, 증류, 프루닝 없이 70B 모델을 4GB GPU 한 장에서 돌릴 수 있고, 학습 기능도 추가됐습니다.

ATF에 주는 도움

고객 현장이 보유한 작은 GPU에서 오픈 모델을 돌리려 할 때 AX consulting에서 비교해 볼 만합니다. 속도와 실제 업무 적합성은 따로 확인해야 합니다.

라이선스

Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.

같은 분야 저장소

  • FareedKhan-dev/kimi-k3-in-c
    GPU, BLAS, 프레임워크 없이 CPU 하나에서 Kimi K3 추론을 돌리는 이식성 있는 C99 엔진이며, 모델을 디스크에서 읽어 옵니다. README는 최대 메모리 사용량이 8.24 GB이고 RAM을 늘리면 속도만 빨라진다고 적고 있습니다.
  • MoonshotAI/Kimi-K3
    Kimi K3는 전체 파라미터 2.8T, 활성 파라미터 104B인 open-weight 멀티모달 Mixture-of-Experts 모델이며, 1백만 token context window를 지원합니다. 텍스트, 이미지, 영상을 이해하고, 긴 시간이 걸리는 coding, 지식 업무, 추론을 목표로 합니다.
  • unslothai/unsloth
    Unsloth는 LLM, diffusion, embedding, 오디오 모델을 실행하고 학습시키는 데스크톱 앱이며 GGUF와 MLX 형식을 지원합니다. 로컬 모델을 Claude Code, Codex, MCP와 함께 쓸 수 있고 웹 검색과 RAG도 제공합니다.
  • drumih/turbo-fieldfare
    Apple Silicon Mac에서 Gemma 4 26B-A4B 모델을 약 2 GB RAM으로 돌리는 Swift와 Metal 기반 runtime입니다. 공유 코어와 KV cache만 메모리에 두고, 필요한 expert만 SSD에서 스트리밍합니다.
  • cactus-compute/needle
    Needle 2는 tool calling, 기기 조작, 구조화된 정보 추출을 위한 45M 파라미터 공개 모델로, 14MB 엔진 하나에 들어갑니다. Python 패키지는 추론, LoRA fine-tuning, 내보내기를 지원하며, tool 호출을 신뢰도 점수와 함께 JSON으로 돌려줍니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)