Sparse Autoencoders Encode Both Concepts and Functions: The Downstream Geometry of Feature Effects
- 발행일
- 출처
- arXiv
- 논문 번호
- 744
- 분야
- Machine Learning
- arXiv 번호
- 2607.24645
SAE 특징이 해석되고 인과적이어도 안정된 조종 방향을 준다는 보장은 없다는 해석가능성 경고.
FEGA는 희소 오토인코더 특징 개입이 모델 출력에 만드는 변화의 기하 구조를 재는 비지도 프레임워크다. 여러 문맥에서 같은 특징을 지워 로짓 변화 구름 모양을 분류한다. 값 같은 특징은 저차원 구조를 더 자주 보이지만 대개 여러 방향에 걸치고, 포인터 같은 특징은 흩어진 효과를 낸다. 특징이 해석 가능하고 인과적이어도 하나의 조종 방향을 주지 않는다는 결론이다.
핵심 요약
- 특징을 지웠을 때 출력 로짓 변화의 기하 구조를 잰다.
- 대부분의 특징은 하나의 안정된 조종 방향을 주지 않는다.
- 값 같은 특징은 저차원 구조를 더 자주 보이지만 여러 방향에 퍼진다.
- 포인터 같은 특징은 대부분 흩어진 효과를 낸다.
- Gemma-2-2B에서 ReLU, TopK, Matryoshka Batch TopK를 비교했다.
- 특징이 해석 가능하고 인과적이어도 조종이 안정적이란 보장은 없다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.