huggingface/transformers

출처
GitHub
처음 오른 날
분야
모델 추론
GitHub 별 수
167,264
주 언어
Python
웹사이트
huggingface.co/transformers (새 탭에서 열림)

외부 오픈소스 저장소를 소개하는 글입니다. HDATF 제품이 아닙니다.

huggingface/transformers

무엇을 하나

Transformers는 텍스트, 이미지, 음성, 영상, 멀티모달 모델의 정의를 모아 추론과 학습에 쓰게 하는 Hugging Face의 Python 라이브러리입니다. 공개 모델을 내려받아 실행하거나 미세 조정하려는 연구자, ML 엔지니어, 개발자가 주요 사용자이고, Hub에는 이 형식의 체크포인트가 100만 개 넘게 공개되어 있습니다. 같은 모델 정의를 Axolotl, Unsloth, DeepSpeed 같은 학습 도구와 vLLM, SGLang, TGI 같은 추론 엔진, llama.cpp와 mlx가 함께 쓰는 기준 역할을 합니다. 모델마다 설정, 모델, 전처리기 세 가지 클래스로 구성되며, Pipeline은 텍스트 생성, 음성 인식, 이미지 분류, 시각 질의응답을 몇 줄 코드로 실행합니다. Trainer는 혼합 정밀도, torch.compile, FlashAttention, 분산 학습을 지원하고, generate는 스트리밍과 여러 디코딩 방식을 제공합니다. 시작하려면 Python 3.10 이상과 PyTorch 2.6 이상이 필요하고, 내려받은 모델은 HF_HUB_CACHE 폴더에 저장되며, 오프라인으로 쓰려면 snapshot_download로 미리 받은 뒤 HF_HUB_OFFLINE=1을 설정합니다. serving 추가 설치로 쓰는 transformers serve는 localhost:8000에 OpenAI SDK 호환 서버를 열어 chat completions, responses, 음성 전사, 모델 목록 같은 엔드포인트를 제공합니다. 도구 호출은 토크나이저가 도구 호출 토큰을 선언한 모델에서 동작하고, 공식 문서는 이 서버를 평가와 실험, 중간 부하 배포용으로 소개하며 대규모 운영에는 vLLM이나 SGLang을 권합니다. 공식 README는 이 라이브러리를 모델 정의 중심 도구로 소개하며, 학습 API는 Transformers가 제공하는 PyTorch 모델에 맞춰져 있어 일반 학습 loop에는 Accelerate를, 예제 스크립트는 상황에 맞게 고쳐 쓰기를 권합니다. README에는 PyTorch, JAX, TF2.0 사이 모델 이동 문구가 남아 있지만 현재 setup.py(5.19.0.dev0)와 설치 문서는 PyTorch만 다루고, 라이브러리는 Apache-2.0이지만 각 체크포인트는 별도 라이선스와 접근 조건을 가질 수 있습니다.

라이선스

Apache-2.0 허용 범위가 넓고 특허 사용 허락이 포함됩니다. 상업적 이용이 가능하며 고지 문구를 유지하고 변경 사실을 밝혀야 합니다.

같은 분야 저장소

  • Tencent-Hunyuan/Hy-MT2
    Hy-MT2는 Tencent Hunyuan 팀이 공개한 번역 전용 언어 모델 묶음으로, 1.8B, 7B, 전문가 혼합(MoE) 구조의 30B-A3B 세 크기가 있습니다. 33개 언어 사이의 번역을 지원하며, 지원 언어 표에 한국어와 일본어가 들어 있습니다. 원문과 번역 지시를 prompt로 넣으면 번역문을 내고, README는 용어 지정, 문체, 개인화, 구분 기호 처리, 구조화 자료 번역용 prompt 양식을 제공합니다. 최대 context 길이는 8192 token이고 기본 system prompt가 없어서, 긴 문서는 나눠 넣는 처리가 필요합니다. 모델 파일을 줄인 FP8과 GGUF 양자화 모델은 2비트와 1.25비트 형식까지 있고, README는 1.8B 모델을 1.25비트로 양자화하면 저장 공간이 약 440MB라고 소개합니다. 실행에는 trust_remote_code(모델 저장소의 코드를 그대로 실행하는 설정)를 켠 transformers 5.6.0 이상이나 소스에서 빌드한 vLLM, SGLang이 필요하고, README는 llama.cpp에서 저비트 형식을 쓰려면 pull request 22836의 STQ kernel이 필요하다고 안내합니다. LLaMA-Factory와 DeepSpeed로 LoRA나 전체 미세 조정을 할 수 있으며, 학습 안내 문서는 1.8B에 24GB 이상 GPU 1장, 7B LoRA에 80GB GPU 1장, 30B에 80GB GPU 8장을 요구합니다. 지시를 따르는 번역을 평가하는 IFMTBench 자료도 CC-BY-4.0으로 공개했으며, 6가지 제약 유형을 규칙과 LLM 채점으로 평가합니다. 모델 라이선스는 LICENSE.txt 기준 Apache 2.0이며, README의 성능 비교 수치는 이번에 따로 확인하지 못했습니다.
  • Ebony-Vinyl/dsh-our-free-model
    dsh 에이전트를 외부 모델 서비스에 연결하는 플러그인이며 모델을 로컬에서 실행하지는 않습니다. 대화와 도구 결과, 선택적으로 이미지를 외부 게이트웨이에 보내고 답변이나 도구 호출을 받습니다. 어댑터는 모델 목록을 갱신하고 사용 가능 여부를 확인하며 여러 응답 규격을 호스트의 실시간 출력 형식으로 바꿉니다. 다른 프로그램이 호출할 수 있는 OpenAI 호환 로컬 전달 서비스와 로컬 사용 기록도 제공합니다. 시작하려면 호환되는 dsh 호스트와 지원되는 Node.js 실행 환경, 네트워크가 필요합니다. Kilo는 무료 모델의 비로그인 호출을 공식 지원하지만 IP 기준 호출 제한을 둡니다. OpenCode 경로는 클라이언트 식별 정보도 흉내 내므로 모든 경로를 공식 공개 API로 보기보다 이용 권한과 약관을 별도로 확인해야 합니다. 다른 계정 채널과 데스크톱 EAC 경로에는 별도 로그인이나 승인이 필요하며 무료 게이트웨이를 무제한 서비스나 민감한 운영 자료용 비공개 서비스로 보아서는 안 됩니다.
  • deepseek-ai/DeepGEMM
    행렬 곱셈과 융합 MoE 등 언어 모델 연산을 위한 CUDA 텐서 코어 커널 라이브러리입니다. DeepJIT으로 실행 시점에 커널을 컴파일합니다.
  • Edge0-AI/Edge0
    Edge0는 SSD 전문가 오프로딩, Recover-LoRA와 라우팅 예측을 사용하는 스트리밍 MoE 추론 프레임워크입니다. README는 공개된 플랫폼별 엔진과 2026년 4분기 예정인 통합 프레임워크를 구분합니다.
  • Vibra-Ingenn/Janus
    gguf model을 자기 컴퓨터에서 돌리는 Go 실행 파일 하나입니다. llama.cpp를 써서 AMD와 Intel, NVIDIA 그래픽의 Vulkan으로 돌리고 없으면 CPU로 돌리며, OpenAI와 같은 모양의 API로 chat completions와 models를 엽니다. 다시 켜지 않고 model을 바꾸고, 추론 부분을 따로 떼어 내고, chat template을 gguf 정보에서 읽습니다. Python과 Docker가 필요하지 않습니다.

Trendshift 순위 목록에 오른 저장소만 담았고, 목록은 후보를 찾는 데만 썼습니다. 순위 숫자는 옮기지 않았습니다. 설명과 라이선스, 별 수는 각 GitHub 저장소에서 확인했습니다. 해설은 우리의 판단입니다. 이 프로젝트들을 직접 시험한 것은 아니며, 상승 목록에 올랐다고 품질이 증명되지는 않습니다.

GitHub에서 보기 (새 탭에서 열림)