Anatomy of Post-Training: Using Interpretability to Characterize Data and Shape the Learning Signal
- 발행일
- 출처
- arXiv
- 논문 번호
- 400
- 분야
- Machine Learning
- arXiv 번호
- 2606.12360
해석 가능성(interpretability) 도구로 포스트 트레이닝 데이터를 감사하고 학습 신호를 정형화하는 데이터 중심 파이프라인. 선호도 데이터의 잠재적 개념을 식별해 바람직하지 않은 학습을 사전에 차단한다.
이 논문은 SAE(Sparse Autoencoder) 특징과 통계적 가설 검정을 활용해 포스트 트레이닝 선호도 데이터셋에서 모델이 학습할 수 있는 잠재적 개념을 사전에 식별하는 파이프라인을 제안한다. 개념 수준에서 바람직하지 않은 신호(예: 과도한 스타일화, 아첨, 안전장치 저하)를 발견하고 explain away 연산으로 제거할 수 있다. Dolci 데이터셋 분석에서 실제로 jailbreak 취약성이 악화됨을 발견했으며, 모델 성격, 공식성, 안전장치 등 원하는 속성을 증폭할 수도 있다.
핵심 요약
- SAE 특징과 이표본 가설 검정으로 선호도 데이터의 잠재 개념(길이, 도움됨, 도덕성, 거부 등) 식별
- 식별된 개념을 explain away하여 바람직하지 않은 학습 신호를 사전 제거하는 데이터 중심 프레임워크
- Dolci 데이터셋 훈련 시 jailbreak robustness 저하 발견 - 기존 SFT 대비 안전성 악화
- 과도한 스타일화, 아첨 현상 진단 및 완화; 모델 성격(playful 등), 공식성 증폭 가능
- 다양한 포스트 트레이닝 프로토콜(DPO, SFT, 데이터 필터링)을 통합 렌즈로 설명
- 인과적 유효 특징이 모델 확률을 예측 가능하게 변경한다는 이론에 기반
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.