Continual Learning via Sparse Memory Finetuning

발행일
출처
arXiv
논문 번호
088
분야
Continual Learning
arXiv 번호
2510.15103

희소 메모리 미세조정이라는 새로운 접근법은 대형 언어 모델이 새로운 지식을 순차적으로 습득하면서도 치명적 망각을 현저히 적게 겪도록 한다.

희소 메모리 미세조정이라는 새로운 접근법은 대형 언어 모델이 새로운 지식을 순차적으로 습득하면서도 치명적 망각을 현저히 적게 겪도록 한다. FAIR at Meta와 UC Berkeley의 연구진이 개발한 이 방법은 메모리 계층 구조를 활용해 관련된 소수의 매개변수만 선택적으로 갱신함으로써, 일반 지식 과제에서의 망각을 전체 미세조정 시 89% 성능 하락에 비해 11% 하락으로 줄인다.

핵심 요약

  • 대형 언어 모델(LLM)은 새로운 정보로 갱신할 때 이전에 습득한 지식을 잃어버리는 치명적 망각을 겪는다.
  • 재현 기반이나 정규화 기법 같은 현재의 LLM 지속 학습 방법은 흔히 연산 비용이 크거나, 데이터 효율이 낮거나, 새로운 학습과 기존 지식 유지 사이의 트레이드오프를 수반한다.
  • LLM은 일반적으로 배포 후 정적 모델로 동작하여, 실시간 정보, 사용자 피드백, 변화하는 세상 지식에 적응하는 능력이 제한된다.
  • 이 논문은 주어진 토큰마다 방대한 메모리 풀의 극히 일부만 본질적으로 접근하는 메모리 계층 구조를 사용하는 희소 메모리 미세조정을 제안한다.
  • 새로운 학습 배치에서 가장 지식 특이적인 메모리 인덱스를 식별하기 위해 TF-IDF 유사 순위 점수를 적용하여 일반 지식과의 간섭을 최소화한다.
  • 미세조정 중에는 TF-IDF 점수로 식별된 상위 t개 메모리 인덱스만 갱신하고, 그 외의 모든 메모리 매개변수와 기본 LLM 매개변수는 그래디언트 마스킹을 통해 고정된 상태로 유지한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)