NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction
- 발행일
- 출처
- arXiv
- 논문 번호
- 1085
- 분야
- LLMs / NLP
- arXiv 번호
- 2609.10715
다음 토큰과 함께 여러 토큰을 묶은 개념도 예측해 언어 모델의 학습 효율과 성능을 높이는 구조를 제안한다.
NCP-ArchPreview는 다음 토큰을 예측하는 기존 방식에 다음 개념을 예측하는 학습 목표를 더한 언어 모델이다. 모델 내부의 표현을 여러 토큰에 걸친 이산적인 개념으로 압축하고, 별도 모듈이 예측한 개념을 다시 토큰 생성에 전달한다. 연구진은 8.9B 규모 모델을 Dolma-3 데이터의 5.73T 토큰으로 학습했으며, 전체 학습 토큰의 51.3%를 사용한 시점에 OLMo-3-7B의 최종 사전학습 손실에 도달했다고 보고했다. 전체 사전학습 뒤에는 OLMo-3-7B보다 후속 과제의 전체 평균 점수가 2.45점, GSM8K 점수가 5.99점 높았다. 개념 관련 모듈만 조정하는 가벼운 분야 적응과 추측 디코딩 보조에도 활용 가능성을 보였지만, 이번 보고서에는 긴 문맥 학습이 포함되지 않았다.
핵심 요약
- 연구 방법은 내부 표현으로 개념 사전을 만들고 다음 개념 예측과 다음 토큰 예측을 함께 학습하며, 예측한 개념을 토큰 생성에 다시 전달하는 것이다.
- 8.9B 모델은 OLMo-3-7B가 사용한 전체 학습 토큰의 51.3%로 해당 기준 모델의 최종 사전학습 손실에 도달했고, 전체 학습 뒤 후속 과제의 전체 평균 점수는 2.45점 높았다.
- 모델 크기를 8.9B로 맞춘 별도 기준 모델과 비교해도 기준 계산량의 85%를 사용해 비슷한 학습 손실에 접근해, 성능 개선이 모델 크기 차이만으로 설명되지 않음을 보였다.
- 17M 규모의 개념 관련 모듈만 조정하는 분야 적응을 제시했으며, 개념 표현을 DFlash2의 초안 생성기에 넣었을 때 평균 수용 길이가 4.17% 늘어 추측 디코딩을 돕는 가능성도 보였다.
- 이번 구조 공개판은 표준 문맥 길이에서 평가됐고 긴 문맥 학습은 포함하지 않아, 장문 처리 환경에서도 같은 이점이 유지되는지는 추가 검증이 필요하다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.