From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

발행일
출처
arXiv
논문 번호
298
분야
LLMs / NLP
arXiv 번호
2606.02559

대규모 언어 모델(LLM)의 사후 학습 압축은 전체 아키텍처 구성 요소를 삭제하거나 적합된 모듈로 대체하여 제거한다.

기존 LLM 대체형 압축은 보통 이어진 전체 층을 골라 삭제하거나 작은 모듈로 바꾸지만, 중복은 층 깊이와 어텐션·피드포워드에 고르게 퍼져 있지 않다. SubFit은 서로 떨어진 어텐션과 피드포워드 하위 모듈을 따로 고르고 각각에 가벼운 잔차 우회 모듈을 맞춘다. 추가 학습이 아니라 보정 자료의 통계로 압축한 뒤 적용할 수 있어 특수 희소 커널이나 새 하드웨어가 필요 없다. 열 개 LLM과 12.5~37.5% 희소도에서 비교 방법보다 종합적인 혼란도·정확도 균형이 좋았고, 25%에서는 원본 정확도의 84.6%를 유지하면서 추론 속도와 KV 캐시를 줄였다. 다만 우회 모듈이 제거한 계산과 파라미터 일부를 다시 더하고 오프라인 압축 시간도 필요하다는 비용이 있다.

핵심 요약

  • 기존의 대체 기반 방법들은 두 가지 설계 제약을 공유한다. 전체 계층 단위의 granularity와 연속적 선택이다.
  • 이러한 직관을 바탕으로, 저자들은 LLM을 서브모듈 수준에서 압축하는 SubFit(서브모듈 수준 적합 잔차 대체, Submodule-level Fitted residual replacement)을 소개한다. 어텐션과 피드포워드 서브모듈은 비연속적으로 선택되며, 각각은 자체적인 경량 적합 잔차 우회 경로를 받는다.
  • SubFit은 사후 학습 단계에서 작동하며 보정 데이터만을 필요로 한다.

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)