HRM-Text: Efficient Pretraining Beyond Scaling
- 발행일
- 출처
- arXiv
- 논문 번호
- 195
- 분야
- LLMs / NLP
- arXiv 번호
- 2605.20613
현재 대규모 언어 모델의 사전학습 패러다임은 방대한 데이터에 의존한다.
HRM-Text는 언어 모델의 계산을 천천히 변하는 전략 층과 빠르게 변하는 실행 층으로 나눈 계층형 순환 구조다. 깊은 순환 학습을 안정시키기 위해 MagicNorm과 준비 단계의 깊은 신용 할당 방법을 넣었다. 일반 원문을 다음 토큰으로 예측하는 대신 지시와 응답 쌍만 사용하고 과제 완료 목표와 PrefixLM 마스킹으로 처음부터 학습했다. 10억 파라미터 모델을 고유 토큰 400억 개와 약 1500달러 예산으로 학습해 MMLU 60.7퍼센트와 GSM8K 84.5퍼센트 등 경쟁력 있는 점수를 보고했다. 표준 기준선보다 토큰은 약 100배에서 900배, 추정 계산량은 96배에서 432배 적게 쓰고 20억에서 70억 파라미터 공개 모델과 견줄 성능을 보여, 구조와 목표의 공동 설계가 사전학습 비용을 낮출 수 있음을 보였다.
핵심 요약
- 이와 대조적으로 생물학적 시스템은 전두두정 루프의 기능적 조직화처럼 다중 시간척도 처리를 통해 매우 표본 효율적인 학습을 보여준다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.