Synthetic Persona Pretraining: Alignment from Token Zero

발행일
출처
arXiv
논문 번호
898
분야
Machine Learning
arXiv 번호
2608.13482

정렬(가치관 주입)을 사후학습이 아니라 사전학습 '첫 토큰'부터 심으면 훨씬 깊이 뿌리내린다는 연구.

이 논문은 한마디로 AI의 가치관을 미리 정한 헌법에 맞춰 사전학습 데이터 단계부터 심는 방법(SPP)을 제안한다. 사전학습 문서 약 10%에 헌법 기반 1인칭 성찰을 붙여 학습시키고, 사후학습에서 이 페르소나(성격·가치관 묶음)를 어시스턴트 정체성에 묶는다. 3B 모델·500B 토큰 실험에서 헌법 준수와 탈옥(프롬프트 조작 공격) 방어가 모두 좋아졌다. 늦게 주입하는 것보다 첫 토큰부터 주입하는 게 확실히 좋았고, 효과는 규모가 클수록 커졌다.

핵심 요약

  • 사전학습 문서에 가치 성찰을 붙여 '페르소나'를 조기에 설치하고, 사후학습에서 이를 어시스턴트 정체성에 묶는 persona binding을 제안했다.
  • 첫 토큰부터 주입하면 헌법 준수가 좋아지고, 훈련에서 다루지 않은 도덕 딜레마에서도 더 정렬된 선택을 했다.
  • 같은 성찰을 사전학습 막바지에만 넣으면 효과가 약했고 가치 우선순위도 바뀌지 않았다.
  • 효과는 사전학습 예산이 커질수록(1.7B/100B → 3B/500B) 더 커졌다.
  • 탈옥 방어는 막바지 주입만으로도 확보됐지만, 깊은 가치 정렬은 조기 주입이 필요했다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)