Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning
- 발행일
- 출처
- arXiv
- 논문 번호
- 1164
- 분야
- safety
- arXiv 번호
- 2609.40286
이 논문은 한 언어에서 지운 지식이 다른 언어에서 되살아나는 허점을 174개 언어 벤치마크로 드러내고, 적은 언어 예산으로 넓게 지우는 COVER 방법을 제안했다.
이 논문은 한마디로 LLM 잊기(unlearning, 특정 지식을 모델에서 지우는 기술)의 다국어 허점을 잡은 연구다. 영어에서 지운 사실이 다른 언어로 질문하면 다시 튀어나오는 교차 언어 허점을 174개 언어·문자 조합 벤치마크로 체계적으로 쟀다. 그리고 COVER라는 방법으로, 감독하지 않는 언어까지 커버가 넓어지는 소수의 소스 언어를 골라 예산 안에서 지우게 했다. 세 모델 family에서 균등 선택 대비 잔여 접근을 7.8~27.3% 줄였다.
핵심 요약
- 174개 언어·문자 쌍과 25가지 표현 변형을 아우르는 교차 언어 잊기 벤치마크를 만들어 잊기가 언제 다른 언어로 번지는지 측정했다.
- 개별적으로 지우는 힘이 센 언어들을 모아도 좋은 소스 집합이 되지 않는다는 뜻밖의 결과를 보이고, 커버리지 예측 기반의 COVER를 제안했다.
- COVER는 배포 시 무해한 보정 데이터와 얼어붙은 모델 접근만 필요해, 전체 다국어 재학습 없이 흉터를 줄인다.
- 세 모델 family·두 forget 집합에서 균등 선택 대비 남은 접근을 평균 7.8~27.3% 낮췄고, 저자원 언어 실제 뉴스 문서에서도 효과가 유지됐다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.