BitNet b1.58 2B4T Technical Report

발행일
출처
arXiv
논문 번호
061
분야
LLMs / Efficiency
arXiv 번호
2504.12285

Microsoft Research는 4조 토큰으로 사전 학습된, 20억 파라미터 규모의 최초 오픈소스·원천 학습 1비트 대규모 언어 모델 BitNet b1.58 2B4T를 도입한다.

Microsoft Research는 4조 토큰으로 사전 학습된, 20억 파라미터 규모의 최초 오픈소스·원천 학습 1비트 대규모 언어 모델 BitNet b1.58 2B4T를 도입한다. 이 모델은 유사한 크기의 완전 정밀도 LLM과 경쟁력 있는 성능을 달성하면서도 훨씬 적은 메모리(0.4 GB)를 요구하고, 더 낮은 디코딩 지연(29 ms)을 보이며, 에너지를 훨씬 적게 소비한다.

핵심 요약

  • 대규모 언어 모델은 계산 집약적이어서 상당한 메모리와 에너지를 요구하고 높은 지연을 유발한다.
  • 이러한 자원 요구는 엣지 디바이스 및 실시간 응용에서의 LLM 배포를 제약한다.
  • 이전의 1비트 양자화 기법은 성능을 저하시키거나(사후 학습 양자화), 경쟁력 있는 모델 크기로 확장되지 못했다.
  • 1.58비트 가중치와 8비트 활성값을 위한 맞춤형 BitLinear 계층을 갖춘 수정된 Transformer 구조를 구현한다.
  • 전례 없는 4조 토큰 사전 학습으로 시작하여 지도 미세 조정과 Direct Preference Optimization으로 이어지는 다단계 학습 방식을 활용한다.
  • GPU와 CPU 모두에서 효율적인 W1.58A8 연산을 위한 맞춤형 커널을 갖춘 특수 추론 라이브러리를 개발하고 오픈소스로 공개한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)