ICA Lens: Interpreting Language Models Without Training Another Dictionary

발행일
출처
arXiv
논문 번호
390
분야
Machine Learning
arXiv 번호
2606.11722

ICA(독립성분분석)를 활용해 SAE 학습 없이도 LLM 활성화에서 해석 가능한 방향을 효율적으로 추출하는 워크플로우 ICALens를 제안한다.

Sparse Autoencoder(SAE)는 LLM 해석 가능성 연구의 표준 도구지만, 층마다 대형 사전을 학습·저장·평가해야 하는 비용이 크다. 이 논문은 고전적 방법인 ICA를 GPU 병렬화와 LLM 특화 안정화 기법으로 실용화한 ICALens를 제안한다. GPT-2 Small, Gemma 2 2B, Qwen 3.5 2B Base에서 ICA가 인간 해석 가능한 방향을 효율적으로 복원하며, SAEBench에서 공개 SAE와 경쟁력 있는 성능을 보인다. 특히 적은 컴포넌트 예산에서는 SAE를 능가한다.

핵심 요약

  • GPU 병렬 FastICA + 행 정규화 + p95-LIM 수렴 기준으로 GPT-2 Small에서 수락 층 수 400% 증가, 반복 횟수 21.5% 감소
  • ICA 방향은 무작위 투영보다 비정규성이 유의미하게 높으며, 깊은 층으로 갈수록 문맥 의존성이 증가하는 패턴(ERF) 확인
  • SAEBench Sparse Probing에서 공개 SAE와 경쟁력 있으며, Targeted Probe Perturbation에서 소~중규모 예산으로 SAE 능가
  • ICA 컴포넌트는 어휘 형태, 국소 통사, 담화 맥락, 의미 중의성, 장거리 반복 등 다양한 언어 구조를 포착
  • SAE 대체재가 아닌 '첫 번째 렌즈'로서의 보완적 역할을 제안하며, 비용 효율적인 탐색 도구로 포지셔닝

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)