Your LLM, Your Style: Behavioral Mode Axes for LLM Behavioral Control
- 발행일
- 출처
- arXiv
- 논문 번호
- 883
- 분야
- Machine Learning
- arXiv 번호
- 2608.10703
이 논문은 LLM의 '성격'을 자기소개 설문이 아닌 실제 행동 데이터로 측정하고, 활성화 공간의 방향으로 행동 스타일을 제어하는 방법을 제안한다.
이 논문은 한마디로 LLM의 성격을 설문지가 아닌 실제 선택과 행동으로 측정하고 제어하는 새로운 프레임워크를 제안한다. 기존 연구는 LLM에게 '너는 외향적이야?' 같은 설문을 했는데, 이는 질문 표현에 따라 결과가 크게 바뀌었다. 대신 3,200개의 구체적 행동 시나리오(예: '정리가 안 된 책상을 어떻게 할 것인가')를 만들어, 1인칭/조언/작업 실행 등 다양한 상황에서 행동을 관찰했다. 그리고 이 행동 패턴을 내부 활성화(뉴런 신호)의 방향으로 표현해(Behavioral Mode Axes), 이 방향을 조절하면 LLM의 행동 스타일을 정밀하게 바꿀 수 있음을 보였다.
핵심 요약
- 3,200개 행동 시나리오(20개 패턴 × 4개 상황)를 구성해 설문 기반 성격 측정의 한계를 극복했다.
- LLM의 행동 스타일이 모델별로 안정적이면서도, 상황(1인칭 vs 조언 vs 작업)에 따라 의미 있게 변한다는 것을 발견했다.
- 행동 모드 축(BMA)을 활성화 공간에서 추출해, 한 방향만 조절하면 행동 스타일을 정밀하게 제어할 수 있음을 7개 모델에서 입증했다.
- 생각 과정에서 추출한 BMA가 응답에서 추출한 BMA보다 훨씬 정확한 제어를 제공했다 (trait drift 현상 발견).
- 행동 제어가 효과적인 층(Behavioral Control Layer)이 모델 전체에 퍼져 있지 않고 특정 구간에 집중돼 있다는 것을 밝혔다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.