Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding
- 발행일
- 출처
- arXiv
- 논문 번호
- 476
- 분야
- LLMs / NLP
- arXiv 번호
- 2606.21906
LLM 추론 시 엔트로피가 최저인 근접 최종층을 동적으로 선택하는 training-free 디코딩 전략으로, 정렬 붕괴를 완화한다.
Confident Decoding은 LLM의 forward pass에서 나타나는 '추측-정제-교란(Guess-Refine-Perturb)' 패턴을 활용하여, 최종층이 아닌 엔트로피 골짜기(최고 신뢰도 층)에서 로짓을 추출하는 학습 불필요 디코딩 전략이다. 정렬(alignment)으로 인해 최종층이 보수적이고 범용적인 토큰으로 편향되는 현상을 우회하며, GPQA-Diamond, Omni-MATH, HLE 등 추론 벤치마크에서 일관된 개선을 보인다. 메모리 오버헤드 없이 레이턴시 2% 미만 추가로 달성된다.
핵심 요약
- Guess-Refine-Perturb 패턴 발견: 초기층은 추측, 중간층은 정제, 최종층은 정렬 편향으로 교란
- 엔트로피 기반 보수적 역방향 탐색으로 최적 근접 최종층을 토큰별 동적 선택
- Dense 및 MoE 아키텍처 모두에서 GPQA-Diamond, Omni-MATH, HLE 등 추론 벤치마크 일관된 개선
- 추가 메모리 0, 레이턴시 2% 미만 증가로 기존 추론 파이프라인에 drop-in 적용 가능
- 정렬(alignment)이 강할수록 최종층 교란 커져 → 모델이 클수록 효과 증가
논문 링크
외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.