Puro-2B: Poor Lab's Qwen2-1.5B Trained on RTX 5090 within $5090
- 발행일
- 출처
- arXiv
- 논문 번호
- 1040
- 분야
- LLMs / NLP
- arXiv 번호
- 2608.27370
게이밍용 그래픽카드(RTX 5090)로 약 6,900달러만 써서 Qwen2-1.5B급 2B 모델을 처음부터 학습시킨 저비용 사전학습 완전 공개 레시피.
이 논문은 한마디로 가성비 그래픽카드만으로 5천 달러대 비용에 2B 규모 언어모델을 처음부터 학습시키는 완전 공개 레시피다. 소규모 연구실도 못 쓰는 사전학습 비용(3B 학습에 수십만~150만 달러)이 문제라, 이 팀은 RTX 5090 클러스터와 FP8 저정밀 학습, 하이퍼볼 최적화, 커리큘럼 모델 평균 등을 조합해 비용을 6,900달러로 낮췄다. 1.4조 토큰으로 학습한 최종 모델은 15개 벤치마크 평균에서 Qwen2-1.5B를 넘고 Qwen2.5-1.5B에 근접했다. 가중치·데이터·코드를 전부 Apache 2.0으로 공개해 재현 가능성을 높였다.
핵심 요약
- 소비자용 RTX 5090 클러스터에서 FP8 저정밀 학습으로 2B 모델 사전학습 비용을 약 6,900달러로 낮췄다.
- 1.4조 토큰·22,514 GPU시간·17.6일 학습으로 Qwen2-1.5B 성능을 넘고 Qwen2.5-1.5B에 근접했다.
- 학습 비용-성능 관계를 맞춘 'Puro 비용 스케일링 법칙'을 제시했고, 약 4,400달러면 Qwen2-1.5B급에 도달한다고 추정했다.
- 하드웨어 선택, 저정밀 학습, 하이퍼볼 최적화, 커리큘럼 모델 평균, 데이터 레시피의 다섯 요소가 비용 효율을 만들었다.
- 가중치 10종, 데이터 매니페스트, 학습·전처리 코드를 Apache 2.0으로 전부 공개했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.