Deeper is Not Always Better:Mitigating the Alignment Tax via Confident Layer Decoding

(arxiv 2026)

Qwen 团队、清华大学和南洋理工大学

motivation

传统上,大型语言模型(LLM)的自回归生成总是使用最后一层(Final Layer)的输出进行解码。

这种做法基于一个假设:模型越深,特征表示就越可靠,最后一层能提供最准确的下一个词预测。

然而,作者通过研究发现,这个“深度单调递增”的假设并不完全成立。

特别是在经过偏好对齐(如 RLHF、DPO)的模型中,最后一层往往会受到“对齐税”(Alignment Tax)的影响,导致模型在处理复杂推理任务时表现下降。

发现

阶段 I:猜测 (Guess,浅层):在最初的几层,模型进行大幅度的方向转移,快速建立初始的粗略统计猜测。

阶段 II:细化 (Refine,中间层):在中间的大部分层,模型沿着稳定的语义轨迹进行渐进式更新,结合上下文逐步完善推理逻辑。

阶段 III:扰动 (Perturb,深层/最后一层):对于某些特定 Token,最后一层会发生强烈的表征偏移。这往往是因为后训练(对齐微调)促使模型偏向于生成高频、通用或“安全”的词汇。这种晚期偏差会破坏中间层已经构建好的复杂推理逻辑链。作者将这种现象称为“规划-语用权衡 (Planning-Pragmatics Tradeoff)”。

提出的方法:Confident Decoding(自信解码)

为了解决最后一层扰动的问题,作者提出了一种免训练、即插即用的推理期解码策略——Confident Decoding

有点像对比解码。

Confident Decoding 并不会扫描从 1 到 $L$ 的所有层(那样计算成本太高且浅层语义未成型),而是将注意力集中在靠近末尾的一个候选层窗口 $\mathcal{C}$ 内:

$$\mathcal{C} = {L-M+1, \dots, L}$$

其中 $M$ 是最大回溯窗口大小(例如论文中常设扫描窗口 $K=10$)。

在 Confident Decoding 中,算法会从最后一层 $L$ 开始,向回(由深到浅) 扫描候选层,寻找局部“熵谷”(Entropy Trough)。

具体搜索规则: 对于每个 Token 的生成,算法沿着 $L, L-1, L-2 \dots$ 的顺序计算熵。如果前一层(较浅层)的熵比当前层(较深层)的熵严格更小(即 $H_t^{(l)} < H_t^{(l+1)}$),则继续向回找;一旦遇到某一层无法进一步降低熵,搜索立刻冻结,并选择当前的“谷底”层作为最终输出层。

数学上,选中的最优层 $l_t^\ast$ 可以表示为:

$$l_t^\ast = \min { l \in [L-K+1, L] : H_t^{(l)} < H_t^{(l+1)} < \dots < H_t^{(L)} }$$

找到 $l_t^\ast$ 后,算法直接将该层的 Logits $z_t^{(l_t^\ast)}$ 送入后续的采样器(Sampler)进行最终的 Token 选取。

为了对比“熵谷”层与最后一层的影响,算法还引入了一个可选的回退概率 $1-p$。

  • 有 $p$ 的概率,算法严格使用找到的熵谷层 $l_t^\ast$。
  • 有 $1-p$ 的概率,算法放弃搜索结果,强制回退到标准解码使用的最后一层 $L$。
  • 实验证明,设置 $p=1.0$(即 100% 确定性地使用熵谷层)能取得最佳效果,因为这彻底隔绝了最后一层引入的对齐扰动。

Deeper is Not Always Better:Mitigating the Alignment Tax via Confident Layer Decoding
https://lijianxiong.space/2026/20260707/
作者
LJX
发布于
2026年7月7日
许可协议