From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression
- 발행일
- 출처
- arXiv
- 논문 번호
- 298
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.02559
대규모 언어 모델(LLM)의 사후 학습 압축은 전체 아키텍처 구성 요소를 삭제하거나 적합된 모듈로 대체하여 제거한다.
기존 LLM 대체형 압축은 보통 이어진 전체 층을 골라 삭제하거나 작은 모듈로 바꾸지만, 중복은 층 깊이와 어텐션·피드포워드에 고르게 퍼져 있지 않다. SubFit은 서로 떨어진 어텐션과 피드포워드 하위 모듈을 따로 고르고 각각에 가벼운 잔차 우회 모듈을 맞춘다. 추가 학습이 아니라 보정 자료의 통계로 압축한 뒤 적용할 수 있어 특수 희소 커널이나 새 하드웨어가 필요 없다. 열 개 LLM과 12.5~37.5% 희소도에서 비교 방법보다 종합적인 혼란도·정확도 균형이 좋았고, 25%에서는 원본 정확도의 84.6%를 유지하면서 추론 속도와 KV 캐시를 줄였다. 다만 우회 모듈이 제거한 계산과 파라미터 일부를 다시 더하고 오프라인 압축 시간도 필요하다는 비용이 있다.
핵심 요약
- 기존의 대체 기반 방법들은 두 가지 설계 제약을 공유한다. 전체 계층 단위의 granularity와 연속적 선택이다.
- 이러한 직관을 바탕으로, 저자들은 LLM을 서브모듈 수준에서 압축하는 SubFit(서브모듈 수준 적합 잔차 대체, Submodule-level Fitted residual replacement)을 소개한다. 어텐션과 피드포워드 서브모듈은 비연속적으로 선택되며, 각각은 자체적인 경량 적합 잔차 우회 경로를 받는다.
- SubFit은 사후 학습 단계에서 작동하며 보정 데이터만을 필요로 한다.
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.