RFI: Rectified Flow Intervention for Mitigating Object Hallucination in Large Vision-Language Models
(AAAI 2026)
厦门大学、华南师范大学。
方法
物体幻觉的数学本质
在理想情况下,生成第 $i$ 个 Token $y_i$ 的概率应当严格依赖于视觉证据:
$$P(y_i \vert{} X_v, X_t, y _ {<i})$$
然而,物体幻觉的发生,是因为模型在深层特征空间中,视觉特征的影响力衰减,导致条件概率退化为语言先验(Language Prior)主导:
$$P(y_i \vert{} X_v, X_t, y _ {<i}) \approx P(y_i \vert{} X_t, y _ {<i})$$
状态分布的构建
为了应用修正流(Rectified Flow),我们首先需要定义特征空间中的两个极端分布。假设在模型的某一个关键层 $l$ 中:
- 分布 $\pi_0$(幻觉/无视觉分布):当我们将视觉输入 $X_v$ 掩码(Mask)或替换为全零噪声时,模型产生的隐藏状态分布。设从该分布中采样的特征为 $Z_0 \sim \pi_0$。这代表了模型仅凭语言习惯瞎猜时的状态。
- 分布 $\pi_1$(真实/视觉对齐分布):当输入完整、高分辨率的 $X_v$ 及对应的真实描述时,模型产生的隐藏状态分布。设从该分布中采样的特征为 $Z_1 \sim \pi_1$。这代表了完美的视觉 grounding 状态。
修正流 (Rectified Flow) 的数学构建
传统扩散模型(Diffusion Models)的转移路径通常是弯曲且复杂的,而修正流(Rectified Flow)旨在寻找从 $\pi_0$ 到 $\pi_1$ 的**最短直线路径(基于最优传输理论 Optimal Transport)。
我们构建一个时间参数 $t \in [0, 1]$。在这个直线路径上,任意时刻的中间特征状态 $Z_t$ 可以表示为:
$$Z_t = t Z_1 + (1 - t) Z_0$$
对时间 $t$ 求导,我们可以得到特征转移的常微分方程(ODE):
$$\frac{dZ_t}{dt} = Z_1 - Z_0$$
这意味着,从幻觉状态 $Z_0$ 走向真实状态 $Z_1$ 的最优“速度方向”是一个常数向量 $(Z_1 - Z_0)$。
训练阶段:学习速度场
在实际推理中,我们无法预知完美的视觉状态 $Z_1$。因此,RFI 需要训练一个轻量级的网络或适配器(Adapter)$v_\theta(Z_t, t)$ 来拟合这个速度方向。
其训练目标是最小化预测速度 $v_\theta$ 与真实直线速度之间的均方误差(MSE):
$$\min_\theta \mathbb{E} _ {Z_0 \sim \pi_0, Z_1 \sim \pi_1, t \sim U[0,1]} \left[ \Vert{} v_\theta(Z_t, t) - (Z_1 - Z_0) \Vert{}^2 \right]$$
通过这种极简的损失函数,网络 $v_\theta$ 学会了:无论当前特征处于什么偏离状态 $Z_t$,都能预测出一个向量,沿着该向量可以将特征最快、最平滑地“推向”视觉真实的分布 $\pi_1$。
推理阶段:动态干预
在模型部署进行图像问答时,RFI 作为一个即插即用的干预模块介入,通常不需要重训 LLM 主干网络。
前向传播:模型接收输入,计算到第 $l$ 层时,得到当前隐藏状态 $h_l$。
实施干预 (The Intervention):设定一个干预步长或强度参数 $\alpha$,利用学好的速度场网络 $v_\theta$,对 $h_l$ 进行残差级别的修正更新:
$$\hat{h} _ l = h _ l + \alpha \cdot v _ \theta(h _ l, t _ {intervene})$$
