Traceable Inference with Graph-Based Evidence Routing for Mitigating Hallucinations in Multimodal Generation
(arxiv 2026)
EMNLP 2026在投
motivation
在多模态生成任务中,给定输入 $X$(可以是图像、音频、视频等),模型需要生成文本输出 $Y$。标准的生成过程可以表示为:
$$Y = \Phi(\mathcal{P} _ {\text{gen}}, X)$$
为了修复幻觉,现有的迭代修复方法通常依赖“当前输出 $Y_t$”和“输入 $X$”共同生成反馈信号 $\mathcal{F}_t$:
$$\mathcal{F}_t = \Phi(\mathcal{P} _ {\text{fb}}, X, Y_t)$$
这种联合调节(joint conditioning)的缺陷在于,生成反馈时,模型会“看”到输出中已经存在的幻觉内容,从而受到误导,非但无法纠错,反而可能强化幻觉。
方法
TIGER 将反馈生成重构为两个完全独立的阶段。
独立原子级图提取
TIGER 独立地从输入 $X$ 和当前输出 $Y_t$ 中提取出事实图:
- 输入观察图:$G_X = \Phi(\mathcal{P} _ {\text{ext}}, X)$
- 输出声明图:$G _ {Y_t} = \Phi(\mathcal{P} _ {\text{ext}}, Y_t)$
图中的每个节点是一个事实,被严格规范为三元组:$f = (s_f, p_f, o_f)$,即 (主体, 谓词, 客体)。共享相同实体的主题会通过“共指边(coreference edges)”连接,形成图结构。




细粒度风险评分
对于声明图 $G _ {Y_t}$ 中的每一个事实 $f$,TIGER 会通过句子特征提取器(如 Sentence-BERT)计算其与观察图 $G_X$ 中事实的相似度,进而得出精确的风险分数。
将输出事实 $f$ 和输入事实 $g$ 的主体、谓词、客体分别通过冻结的句子编码器提取特征,得到截断余弦相似度 $\sigma_s, \sigma_p, \sigma_o \in [0, 1]$。整体相似度定义为三个维度的均值:
$$\text{sim}(f, g) = \frac{1}{3}(\sigma_s + \sigma_p + \sigma_o)$$
步骤 A:计算局部支持度 (Local Support) 首先计算声明事实 $f$ 与输入图 $G_X$ 中所有事实 $g$ 的最大相似度:
$$s_0(f) = \max _ {g \in G_X} \text{sim}(f, g)$$
步骤 B:图结构支持度传播 (Graph-Propagated Support) 为了防止事实提取器偶尔遗漏输入信息导致误判,TIGER 利用共指边在图内传播支持度。如果一个实体的某个声明得到了支持,关于该实体的其他声明也会获得部分支持:
$$s(f) = \max _ {f’ \in {f} \cup \mathcal{N}_K(f)} \gamma^{d(f,f’)} \cdot s_0(f’)$$
- $\mathcal{N}_K(f)$ 表示节点 $f$ 的 $K$ 跳共指邻居。
- $d(f, f’)$ 表示节点间的跳数距离。
- $\gamma \in (0, 1)$ 是几何衰减因子(距离越远,传播的支持度越低)。
步骤 C:计算冲突度 (Conflict) 冲突度用于衡量输出事实是否与输入事实产生了直接矛盾。冲突计算被设计为一个“软门控(soft gate)”机制:
$$\text{conflict}(f, g) = \frac{1}{2}(\sigma_s + \sigma_p) \cdot (1 - \sigma_o)$$
- $\frac{1}{2}(\sigma_s + \sigma_p)$ 代表主题一致性(主语和谓语是否匹配)。
- $(1 - \sigma_o)$ 代表结论分歧度(宾语/结论差异有多大)。
- 只有当两者讨论同一主体和动作,但得出了完全不同的结论时,冲突值才会显著升高。
该事实的最终冲突分数为它在输入图中的最大冲突值:
$$c(f) = \max _ {g \in G_X} \text{conflict}(f, g)$$
步骤 D:综合风险评估 (Total Risk) 结合缺乏支持和直接冲突,每个事实 $f$ 的最终风险分数被定义为:
$$r(f) = (1 - s(f)) + \lambda \cdot c(f)$$
- $\lambda > 0$ 是控制冲突权重的一个超参数。
基于预算的局部修复
计算出每个事实的风险分数后,TIGER 不会随意让模型重写全部内容,而是进行受控的预算分配。
设声明图中共有 $N$ 个事实,TIGER 仅选取风险分数最高的 $\lceil \alpha N \rceil$ 个事实构成高风险集合 $\mathcal{F}_t$。模型在修复时被强制要求局部运作:仅针对这些选出的高风险事实,参考原始输入 $X$ 进行修正或删除,其余低风险文本保持冻结:
$$Y _ {t+1} = \Phi(\mathcal{P} _ {\text{refine}}, X, Y_t, \mathcal{F}_t)$$
它的局部重写机制遵循以下几个核心操作规则:
1. 明确的输入上下文
在执行修复步骤 $Y _ {t+1} = \Phi(\mathcal{P} _ {\text{refine}}, X, Y_t, \mathcal{F}_t)$ 时,模型会同时接收到三部分信息:
- 原始的原始输入(Raw Input $X$):模型直接“看”到原始的图像、音频、视频或文本,而不是仅仅依赖之前提取的图结构。
- 当前的文本输出(Current Output $Y_t$):即需要被修改的上一轮生成的草稿。
- 高风险事实列表(High-risk Claims $\mathcal{F}_t$):被上一步算法选出的事实会被转化为自然语言列表(如“被标记为高风险的声明”),直接提供给模型。
2. 严格的三重编辑策略
TIGER 在提示词中针对这些被标记的高风险事实,强制规定了具体的处理策略:
- 纠正(Correct):如果该声明与输入(Input)存在直接矛盾,模型必须将其修改为与输入相符的内容。
- 保留(Keep):如果模型在重新检查时发现该声明实际上是受输入支持的(起到二次核对的作用),则保留该声明。
- 删除(Remove):如果该声明无法被输入验证,并且也找不到有根据的替代信息,模型必须将其从响应中删除(允许生成更短的响应)。
3. 强制的“局部”约束
为了确保重写是“局部”的,防止模型借机发散或产生新的幻觉,提示词中包含了严格的边界限制:
- 模型被明确要求不要添加新的事实细节。
- 模型被要求不要修改未被标记的声明,除非是为了保持上下文连贯性所需的最低限度的语法编辑。
- 每个被选中的高风险事实都保留了其在源文本中的位置,因此模型在相应的跨度(span)上进行局部修复。


理论
定理 3.1(条件几何风险界限,Conditional geometric risk bound),它证明了在多次迭代后,生成的文本的总幻觉风险会呈几何级数下降,并最终逼近一个明确的理论下界。
定义
在第 $t$ 轮迭代时,当前输出的声明图 $G _ {Y_t}$ 包含 $N_t = |G _ {Y_t}|$ 个事实。
总风险 ($R^{(t)}$):当前图谱中所有事实的风险总和被定义为 $R^{(t)} = \sum _ {f \in G _ {Y_t}} r^{(t)}(f)$。
高风险集合 ($\mathcal{F}_t$):算法会根据预算比例 $\alpha \in (0, 1]$ 挑出风险最高的 $\lceil\alpha N_t\rceil$ 个事实构成 $\mathcal{F}_t$。
因此,总风险可以分解为“被选中修复的部分”和“被保留(不修复)的部分”:
$$R^{(t)} = \sum _ {f \in \mathcal{F}_t} r^{(t)}(f) + \sum _ {f \in G _ {Y_t} \setminus \mathcal{F}_t} r^{(t)}(f)$$
在执行一次局部修复后,理想状态下(假设图提取完美无缺),下一轮的理想总风险 $\tilde{R}^{(t+1)}$ 包括:修复后事实的新风险 $\tilde{r}^{(t+1)}(f)$、未修复事实的原始风险 $r^{(t)}(f)$,以及修复操作带来的增量副作用风险 $\Delta_t^+ \ge 0$。 但是,由于大模型提取事实图时存在“提取损失”,下一轮实际测量到的总风险 $R^{(t+1)}$ 与理想风险之间存在差距,定义为提取损失 $\Delta_t^{ext} = R^{(t+1)} - \tilde{R}^{(t+1)}$。
综合起来,单步风险演化公式被严格分解为以下四部分:
$$R^{(t+1)} = \sum _ {f \in \mathcal{F}_t} \tilde{r}^{(t+1)}(f) + \sum _ {f \in G _ {Y_t} \setminus \mathcal{F}_t} r^{(t)}(f) + \Delta_t^+ + \Delta_t^{ext}$$
四大核心假设
为了进行严密的证明,论文在 Appendix D.2 提出了四个合理的理论前提:
假设 D.1 (有界图大小, Bounded graph size):存在一个常数 $N _ {max}$,使得所有轮次的事实数量 $N_t \le N _ {max}$。
假设 D.2 (单事实修复进展, Per-fact repair progress):存在一个常数 $\epsilon \in (0, 1]$,使得对于每个被选中的高风险事实 $f \in \mathcal{F}_t$,修复操作能在期望上将其风险降低 $\epsilon$ 比例:
$$\mathbb{E}[\tilde{r}^{(t+1)}(f) | R^{(t)}] \le (1 - \epsilon)r^{(t)}(f)$$
假设 D.3 (有界副作用, Bounded side effects):局部重写可能对周围原本无错的文本造成扰动,假设这种预期的附加风险被常数 $\beta \ge 0$ 限定:
$$\mathbb{E}[\Delta_t^+ | R^{(t)}] \le \beta$$
假设 D.4 (有界提取损失, Bounded extraction loss):事实提取器可能漏掉某些事实,这种预期误差被常数 $\xi \ge 0$ 限定:
$$\mathbb{E}[\Delta_t^{ext} | R^{(t)}] \le \xi$$
证明推导过程
证明的目标是推导出经过 $T$ 轮修复后,期望风险 $\mathbb{E}[R^{(T)}]$ 的上界。证明逻辑如下(详见 Appendix D.3):
步骤一:推导单步“漂移不等式” (Drift Inequality)
对前面定义的单步风险分解公式两边求条件期望(给定上一轮的总风险 $R^{(t)}$),并代入上述四个假设:
$$\mathbb{E}[R^{(t+1)} | R^{(t)}] \le (1 - \epsilon)\sum _ {f \in \mathcal{F}_t} r^{(t)}(f) + \sum _ {f \in G _ {Y_t} \setminus \mathcal{F}_t} r^{(t)}(f) + \beta + \xi$$
将其重新整理,把被修复部分的风险单独提出来:
$$\mathbb{E}[R^{(t+1)} | R^{(t)}] \le R^{(t)} - \epsilon\sum _ {f \in \mathcal{F}_t} r^{(t)}(f) + \beta + \xi$$
步骤二:利用“Top-K 选择”特性放大减法项
算法在挑选 $\mathcal{F}_t$ 时,选的是风险最高的 $\lceil\alpha N_t\rceil$ 个事实。因此,这些被选中事实的平均风险一定大于等于全局平均风险 $R^{(t)} / N_t$。 即:$\sum _ {f \in \mathcal{F}_t} r^{(t)}(f) \ge \lceil\alpha N_t\rceil \frac{R^{(t)}}{N_t} \ge \alpha R^{(t)}$。 将这个不等式代入上一步,可以得到一个完美的单步衰减公式:
$$\mathbb{E}[R^{(t+1)} | R^{(t)}] \le (1 - \alpha\epsilon)R^{(t)} + \beta + \xi$$
这说明每一轮迭代,现有的总风险都会被硬性砍掉 $\alpha\epsilon$ 这个比例,并叠加一个固定的常数误差 $(\beta + \xi)$。
步骤三:通过数学归纳法展开 $T$ 轮
去掉条件期望后得到递归式 $\mathbb{E}[R^{(t+1)}] \le (1 - \alpha\epsilon)\mathbb{E}[R^{(t)}] + \beta + \xi$。 假设这个结论在第 $t$ 轮成立,根据等比数列求和法则将其展开到第 $T$ 轮:
$$\mathbb{E}[R^{(T)}] \le (1 - \alpha\epsilon)^T R^{(0)} + (\beta + \xi)\sum _ {j=0}^{T-1}(1 - \alpha\epsilon)^j$$
由于 $\sum _ {j=0}^{T-1}(1 - \alpha\epsilon)^j \le \frac{1}{\alpha\epsilon}$,最终得到定理 3.1 的结论:
$$\mathbb{E}[R^{(T)}] \le (1 - \alpha\epsilon)^T R^{(0)} + \frac{\beta + \xi}{\alpha\epsilon}$$
物理意义与结论
最终得出的这个公式揭示了 TIGER 系统非常重要的运作本质:
- 几何级数下降(Geometric Decrease):公式左侧的 $(1 - \alpha\epsilon)^T R^{(0)}$ 表示初始阶段的幻觉风险 $R^{(0)}$ 随着迭代轮数 $T$ 的增加,会以 $(1-\alpha\epsilon)$ 的底数呈几何级数(指数级)被消除。
- 能力天花板/渐近底线(Asymptotic Floor):公式右侧的常数项 $\frac{\beta + \xi}{\alpha\epsilon}$ 代表了系统无法彻底清零的残余风险。它表明,即使无限次迭代(当 $T \to \infty$ 时,第一项趋于 0),幻觉依然无法绝对等于 0,因为总会存在提取损失($\xi$)和局部修改带来的上下文副作用($\beta$)。这诚实地刻画了该框架的能力边界。
实验

题外话
同是EMNLP 2026,它写得真好啊。