lyogavin/airllm
- 출처
- GitHub
- 처음 오른 날
- 분야
- 모델 추론
- GitHub 별 수
- 34,422
- 주 언어
- Jupyter Notebook
외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

무엇을 하나
AirLLM은 모델 레이어를 하나씩 차례로 불러와 대형 언어 모델 추론에 필요한 GPU 메모리를 줄입니다. 양자화, 증류, 프루닝 없이 70B 모델을 4GB GPU 한 장에서 돌릴 수 있고, 학습 기능도 추가됐습니다.
ATF에 주는 도움
고객 현장이 보유한 작은 GPU에서 오픈 모델을 돌리려 할 때 AX consulting에서 비교해 볼 만합니다. 속도와 실제 업무 적합성은 따로 확인해야 합니다.
라이선스
Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.
같은 분야 저장소
- FareedKhan-dev/kimi-k3-in-c
GPU, BLAS, 프레임워크 없이 CPU 하나에서 Kimi K3 추론을 돌리는 이식성 있는 C99 엔진이며, 모델을 디스크에서 읽어 옵니다. README는 최대 메모리 사용량이 8.24 GB이고 RAM을 늘리면 속도만 빨라진다고 적고 있습니다. - MoonshotAI/Kimi-K3
Kimi K3는 전체 파라미터 2.8T, 활성 파라미터 104B인 open-weight 멀티모달 Mixture-of-Experts 모델이며, 1백만 token context window를 지원합니다. 텍스트, 이미지, 영상을 이해하고, 긴 시간이 걸리는 coding, 지식 업무, 추론을 목표로 합니다. - unslothai/unsloth
Unsloth는 LLM, diffusion, embedding, 오디오 모델을 실행하고 학습시키는 데스크톱 앱이며 GGUF와 MLX 형식을 지원합니다. 로컬 모델을 Claude Code, Codex, MCP와 함께 쓸 수 있고 웹 검색과 RAG도 제공합니다. - drumih/turbo-fieldfare
Apple Silicon Mac에서 Gemma 4 26B-A4B 모델을 약 2 GB RAM으로 돌리는 Swift와 Metal 기반 runtime입니다. 공유 코어와 KV cache만 메모리에 두고, 필요한 expert만 SSD에서 스트리밍합니다. - cactus-compute/needle
Needle 2는 tool calling, 기기 조작, 구조화된 정보 추출을 위한 45M 파라미터 공개 모델로, 14MB 엔진 하나에 들어갑니다. Python 패키지는 추론, LoRA fine-tuning, 내보내기를 지원하며, tool 호출을 신뢰도 점수와 함께 JSON으로 돌려줍니다.
Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.