Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

(ICLR 2026)

又是加强版VTI。

背景

幻觉的三种主要类型

  • 类别幻觉 (Category Hallucination):例如,因为滑雪场景中常出现滑雪板,模型会将“背包”错误识别为“滑雪板”。
  • 属性幻觉 (Attribute Hallucination):例如,由于文本先验认为“手套通常成对出现”,模型会错误地数错手套的数量。
  • 关系幻觉 (Relation Hallucination):例如,模型受到“人戴着头盔”这一高频关联的干扰,而忽略了图片中实际是“人拿着头盔”的视觉事实。

现有方法的局限性:此前的推理期“激活编辑(Activation Editing)”方法(如VTI和ICT)主要通过给图像添加噪声或模糊来构建编辑向量,它们忽略了事实文本语义提供的积极引导,因此难以明确且有效地缓解语言偏见。同时,这些方法使用的是统一的编辑向量,无法适应不同查询的具体需求。

方法

激活编辑 (Activation Editing)

在大型视觉语言模型(LVLM)处理图像 $x$ 和问题 $q$ 时,信息会逐层通过多头自注意力机制(Self-Attention)。第 $l$ 层的隐藏状态更新公式如下:

$$h^{l+1}=h^{l}+Concat _ {k=1}^{H}(z^{l,k})\cdot W _ {o}^{l}$$

在这里,$z^{l,k}$ 表示第 $l$ 层第 $k$ 个注意力头输出的内部激活值,$W _ {o}^{l}$ 是输出投影矩阵。

当模型产生幻觉时,通常是因为 $z^{l,k}$ 受到了语言偏见的严重干扰。传统的激活编辑方法会构建一个统一的编辑向量 $\overline{d}$,并按一定强度 $\alpha$ 注入到模型中来强行干预:

$$h^{l+1}=h^{l}+Concat _ {k=1}^{H}(z^{l,k}+\alpha\cdot\overline{d})\cdot W _ {o}^{l}$$

然而,传统方法通常通过模糊或添加噪声来构建 $\overline{d}$,缺乏明确的事实引导,且无法根据不同的问题动态调整。AFTER 正是为了解决这两个痛点而设计的。

核心模块一:FAS (事实增强的激活引导)

FAS 的目的是利用真实的图像标注(Ground-truth)构建一个通用的、正确的图文编辑方向 ($\overline{d}$),为模型提供积极的引导。

步骤 1:事实提取与文本化 首先,从图像的真实标注中提取出三种幻觉相关的事实:类别事实 $T^{c}$、属性事实 $T^{a}$ 和关系事实 $T^{r}$。然后,利用现有的 LVLM(记为 $\mathcal{F}$)将这些离散事实整合成一段连贯且客观的文本描述 $t^{+}$:

$$t^{+}=\mathcal{F}(I _ {fst};(x,[T^{c},T^{a},T^{r}]))$$

这里 $t^{+}$ 就代表了“受信任的事实语义”。

步骤 2:构建通用编辑向量 针对同一组多样化的问题集合 ${q _ {i}}$,将“包含事实的文本 $t^{+}$”作为受信任输入,将“可能引发幻觉的原始图像 $x$”作为不受信任输入,分别送入模型获取激活值 $z _ {i}^{+}$ 和 $z _ {i}$。 接着,计算它们在整个图像集 $X$ 上的平均差异,得出通用引导向量 $\overline{d}$:

$$\overline{d}=\frac{1}{n\cdot\vert{}X\vert{}}\sum _ {X}\sum _ {i=1}^{n}(z _ {i}^{+}-z _ {i})$$

这个向量 $\overline{d}$ 能够从宏观上代表“将错误视觉感知拉回到正确文本事实”的通用方向。

核心模块二:QAO (查询自适应偏移优化)

通用向量 $\overline{d}$ 只能提供一个粗略的方向,但用户的每一个查询 $q _ {i}$ 关注的视觉对象都不同。QAO 的作用是为通用向量计算一个特定的“偏移量”,实现针对当前查询的定制化编辑。

步骤 1:构建查询专属的文本语义 根据当前问题 $q _ {i}$ 提到的对象,从整体事实描述 $t^{+}$ 中提取出与该对象直接相关的子描述 $t _ {i}^{}$。通过这种方式,获取针对特定查询的受信任激活值 $z _ {i}^{}$。

步骤 2:计算期望的偏移量 对于特定的查询,其最理想的编辑向量应当是 $\tilde{d} _ {i}=z _ {i}^{*}-z _ {i}$。因此,在通用向量 $\overline{d}$ 的基础上,我们需要补偿的期望偏移量为 $o _ {i}=\tilde{d} _ {i}-\overline{d}$。

步骤 3:训练轻量级偏移估算器 为了在推理时不依赖真实的标注,作者构建了数据集 $\mathcal{D}={(z _ {i},o _ {i})\vert{}i\in[1,n]}$,并训练了一个查询感知的偏移估算器 $\mathcal{G}$(由单层 MLP 构成)。其损失函数使用均方误差(MSE):

$$\mathcal{L} _ {\mathcal{G}}=\frac{1}{n\cdot\vert{}X\vert{}}\sum _ {X}\sum _ {i=1}^{n}\vert{}\vert{}\mathcal{G}(z _ {i})-o _ {i}\vert{}\vert{}^{2}$$

训练完成后,估算器 $\mathcal{G}$ 能够根据当前不受信任的视觉激活值 $z _ {i}$,直接预测出当前查询所需的自适应偏移量。

推理阶段

在实际应用(推理阶段)时,AFTER 会直接利用训练好的通用向量 $\overline{d}$ 和偏移估算器 $\mathcal{G}$,对受语言偏见影响最大的前 $K$ 个注意力头进行干预。

结合了事实引导与查询自适应的最终特征更新公式为:

$$h^{l+1}=h^{l}+Concat _ {k=1}^{H}(z^{l,k}+\alpha\cdot[\mathcal{G}(z^{l,k})+\overline{d}])\cdot W _ {o}^{l}$$


Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing
https://lijianxiong.space/2026/20260721/
作者
LJX
发布于
2026年7月21日
许可协议