Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal

발행일
출처
arXiv
논문 번호
400
분야
Machine Learning
arXiv 번호
2606.12360

해석 가능성(interpretability) 도구로 포스트 트레이닝 데이터를 감사하고 학습 신호를 정형화하는 데이터 중심 파이프라인. 선호도 데이터의 잠재적 개념을 식별해 바람직하지 않은 학습을 사전에 차단한다.

이 논문은 SAE(Sparse Autoencoder) 특징과 통계적 가설 검정을 활용해 포스트 트레이닝 선호도 데이터셋에서 모델이 학습할 수 있는 잠재적 개념을 사전에 식별하는 파이프라인을 제안한다. 개념 수준에서 바람직하지 않은 신호(예: 과도한 스타일화, 아첨, 안전장치 저하)를 발견하고 explain away 연산으로 제거할 수 있다. Dolci 데이터셋 분석에서 실제로 jailbreak 취약성이 악화됨을 발견했으며, 모델 성격, 공식성, 안전장치 등 원하는 속성을 증폭할 수도 있다.

핵심 요약

  • SAE 특징과 이표본 가설 검정으로 선호도 데이터의 잠재 개념(길이, 도움됨, 도덕성, 거부 등) 식별
  • 식별된 개념을 explain away하여 바람직하지 않은 학습 신호를 사전 제거하는 데이터 중심 프레임워크
  • Dolci 데이터셋 훈련 시 jailbreak robustness 저하 발견 - 기존 SFT 대비 안전성 악화
  • 과도한 스타일화, 아첨 현상 진단 및 완화; 모델 성격(playful 등), 공식성 증폭 가능
  • 다양한 포스트 트레이닝 프로토콜(DPO, SFT, 데이터 필터링)을 통합 렌즈로 설명
  • 인과적 유효 특징이 모델 확률을 예측 가능하게 변경한다는 이론에 기반

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)