Minimally Invasive Steering of Language Models
- 발행일
- 출처
- arXiv
- 논문 번호
- 1131
- 분야
- Machine Learning
- arXiv 번호
- 2609.30218
이 논문은 고정된 LLM을 굳이 재학습하지 않고, 마지막 은닉 상태에 벡터를 더해 원하는 보상으로 조종하면서도 품질 저하를 최소화하는 방법(MISVO)을 제안했다.
이 논문은 한마디로 '가벼운 성향 조종(steering)'의 부작용을 수학적으로 잡은 연구다. 언어 모델 출력 분포를 바꾸는 벡터를 무작정 최적화하면 보상은 올라가지만 문장 품질이 무너진다. MISVO는 KL 발산(두 분포의 차이 척도)의 국소 기하를 Fisher 행렬로 근사해 '얼마나 분포를 흔드는지'를 벌점으로 넣는다. 기울기는 얼어 있는 모델 머리와의 행렬-벡터 곱만으로 계산된다. 1B~14B 모델의 선호·코드 생성 과제에서 7개 설정 중 6개에서 최고 평균 보상을 얻으면서도 다양성·일관성은 Best-of-N과 비슷했다.
핵심 요약
- 재학습 없이 마지막 은닉 상태에 더하는 벡터만으로 모델 성향을 조정하되, 분포를 흔드는 정도를 Fisher 이차형 벌점으로 억제한다.
- 시퀀스 전체 KL 기울기를 해석적 항과 점수 함수 항으로 정확히 분해하고, 근사의 타당성을 1차 오더에서 증명했다.
- 계산은 얼어 있는 모델 머리와의 행렬-벡터 곱이라 학습 없이도 위치별 조종 벡터를 최적화할 수 있다.
- 1B~14B 모델의 선호·코드 생성 7개 설정 중 6개에서 최고 평균 보상을 기록했고, 문장 다양성·일관성은 Best-of-N 수준을 유지했다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.