Towards Mechanistically Understanding Why Memorized Knowledge Fails to Generalize in Large Language Model Finetuning

발행일
출처
arXiv
논문 번호
590
분야
AI / General
arXiv 번호
2607.08393

파인튜닝으로 주입한 지식이 추론에 쓰이지 않는 '아는-쓰는 갭'을 self-patching 기법으로 기계적 해석 가능성 관점에서 분석한 연구.

LLM 파인튜닝 시 새 지식을 빠르게 암기하지만 추론에 활용하지 못하는 '아는-쓰는 갭(Knowing-Using Gap)'을 정식화하고, self-patching이라는 개입 기법으로 내부 어느 층에서 지식이 갇혀있는지 추적한다. 지식이 저장 계층(초기/후기 층)에는 있지만 추론 회로가 있는 중간 층으로 라우팅되지 않는 '지식-회로 미정렬'이 원인임을 밝혔다. 고정 휴리스틱만으로 오라클 개선의 58-75%를 회복하며, 6개 모델 × 2도메인 교차 검증으로 견고성을 확인했다.

핵심 요약

  • '아는-쓰는 갭(Knowing-Using Gap)' 정식화: 암기는 거의 완벽하지만 일반화(다단계 추론)는 크게 뒤처지는 현상
  • self-patching 기법 도입: 특정 층의 표현을 다른 위치로 이동시켜 일반화 실패를 즉시 회복하는 인과적 진단 도구
  • 지식-회로 미정렬 가설: 암기된 표현이 초기/후기 층에는 있지만 중간 추론 층으로 라우팅되지 않아 실패 발생
  • Qwen-2.5(1.5B~7B), LLaMA-3.2(1B~8B) 6개 모델 × 생의학/학술 2개 도메인 교차 검증으로 견고성 입증
  • 고정 휴리스틱(전체 층의 0.8L→0.5L, 0.1L→0.5L 두 쌍만 사용)으로 오라클 개선의 58-75% 회복
  • CoT 프롬프팅이나 무관련 패칭보다 self-patching이 월등히 우수하여 구조적 원인임을 지지

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)