Deeper is Not Always Better: Mitigating the Alignment Tax via Confident Layer Decoding

발행일
출처
arXiv
논문 번호
476
분야
LLMs / NLP
arXiv 번호
2606.21906

LLM 추론 시 엔트로피가 최저인 근접 최종층을 동적으로 선택하는 training-free 디코딩 전략으로, 정렬 붕괴를 완화한다.

Confident Decoding은 LLM의 forward pass에서 나타나는 '추측-정제-교란(Guess-Refine-Perturb)' 패턴을 활용하여, 최종층이 아닌 엔트로피 골짜기(최고 신뢰도 층)에서 로짓을 추출하는 학습 불필요 디코딩 전략이다. 정렬(alignment)으로 인해 최종층이 보수적이고 범용적인 토큰으로 편향되는 현상을 우회하며, GPQA-Diamond, Omni-MATH, HLE 등 추론 벤치마크에서 일관된 개선을 보인다. 메모리 오버헤드 없이 레이턴시 2% 미만 추가로 달성된다.

핵심 요약

  • Guess-Refine-Perturb 패턴 발견: 초기층은 추측, 중간층은 정제, 최종층은 정렬 편향으로 교란
  • 엔트로피 기반 보수적 역방향 탐색으로 최적 근접 최종층을 토큰별 동적 선택
  • Dense 및 MoE 아키텍처 모두에서 GPQA-Diamond, Omni-MATH, HLE 등 추론 벤치마크 일관된 개선
  • 추가 메모리 0, 레이턴시 2% 미만 증가로 기존 추론 파이프라인에 drop-in 적용 가능
  • 정렬(alignment)이 강할수록 최종층 교란 커져 → 모델이 클수록 효과 증가

논문 링크

외부 연구를 정리한 자료입니다. HDATF가 발표한 논문이나 제품 성능을 측정한 결과는 아닙니다.

원문 보기 (새 탭에서 열림)