More Tokens are Better but Not Necessary in Forensic Vision-Language Models

(arxiv 2026)

为多媒体取证任务中的MLLMs设计的免训练视觉 token 压缩框架。

深大、哈工深、中山大学网安


motivation

虽然现有的 token 剪枝方法能够加速推理,但它们大多是“语义驱动”的,即倾向于保留显著的宏观对象,而丢弃背景区域。

这在取证检测中会导致严重的问题,论文基于此提出了两个核心观察:

  • 语义显著性与取证证据的负相关:伪造痕迹(如高频噪声、混合接缝或重采样网格)通常分布在视觉上平坦、低显著性的背景或边缘区域中。传统的语义剪枝会把这些关键的取证证据过滤掉。
  • 时间不连续性表现为生灭(Birth-Death)事件:在真实的连续视频帧中,token 的演变是平滑的,符合质量守恒。然而,生成模型生成的伪造视频会破坏物理连续性,导致在特征空间中出现某些纹理或结构在两帧之间突然凭空出现(生)或突然消失(灭)的情况。

方法

为了捕捉这些物理异常,ForensicZip 提出了两个互补的阶段:**传输新颖性估计(TNE)**和**取证打分与选择(FS)**。

1. 传输新颖性估计 (Transport Novelty Estimation, TNE)

这一阶段主要在时间域检测伪造痕迹。常规的最优传输(Balanced Optimal Transport)会强制所有目标 token 匹配到一个来源,这会稀释突然出现的生成伪影的分数。因此,TNE 引入了一个带有虚拟节点(Dummy Node)的生灭熵最优传输(Birth-Death Entropic Optimal Transport)模型,专门吸收那些无法匹配的异常质量。

步骤 A:特征投影与归一化 对于第 $t$ 帧中的每个 patch token $v _ {t,i} \in \mathbb{R}^{D_v}$,首先将其投影到语言嵌入空间,并进行 $l_2$ 归一化,使其映射到单位超球面上:

$$\hat{z} _ {t,i} = \frac{g(v _ {t,i})}{\vert{}\vert{}g(v _ {t,i})\vert{}\vert{}_2 + \epsilon _ {norm}} \in \mathbb{R}^{D_p}$$

其中 $\epsilon _ {norm}$ 是用于数值稳定性的极小常数。

步骤 B:构建带有虚拟节点的增强代价矩阵 对于连续的两帧 $t-1$ 和 $t$,先计算真实 token 之间的余弦距离矩阵 $C^{(t)}$,其元素为 $C _ {ij}^{(t)} = 1 - \hat{z} _ {t-1,i}^\top \hat{z} _ {t,j}$。 为了量化无来源的“突然出现”(Birth)和无目标的“突然消失”(Death),引入虚拟行和列,构建增强矩阵 $\bar{C}^{(t)} \in \mathbb{R}^{(N+1)\times(N+1)}$:

$$\bar{C}^{(t)} = \begin{bmatrix} C^{(t)} & c _ {death}1_N \ c _ {birth}1_N^\top & 0 \end{bmatrix}$$

这里 $c _ {birth} \ge 0$ 和 $c _ {death} \ge 0$ 是将质量路由到虚拟节点的固定惩罚代价。当真实匹配的代价超过 $c _ {birth}$ 时,模型会倾向于将其判定为新生成的伪影。

步骤 C:求解传输计划 设定边缘约束 $a = [\frac{1}{N}, \dots, \frac{1}{N}, 1]^\top \in \mathbb{R}^{N+1}$(前 $N$ 项为真实 token 分配均匀质量,最后一项提供单位松弛量以吸收不匹配质量)。通过 Sinkhorn 迭代求解带有熵正则化(强度为 $\epsilon _ {ot}$)的最优传输计划 $\bar{P}^{(t)}$:

$$\bar{P}^{(t)} = \arg\min _ {P \ge 0, P 1 = a, P^\top 1 = a} \langle P, \bar{C}^{(t)} \rangle_F + \epsilon _ {ot} \sum _ {i=1}^{N+1} \sum _ {j=1}^{N+1} P _ {ij}(\log P _ {ij} - 1)$$

步骤 D:提取每个 Token 的时间异常分数 从求解出的传输计划中,为第 $t$ 帧的每个目标 token $j$ 提取两个核心分数:

  1. 传输代价 (Transport cost):量化了偏离前驱节点但仍部分匹配的分布式异常。

    $$e_j^{(t)} = \sum _ {i=1}^N \bar{P} _ {ij}^{(t)} C _ {ij}^{(t)}$$

  2. 生成证据 (Birth evidence):记录了从虚拟节点路由来的质量,直接量化了 token 凭空出现(无合理前驱)的程度。

    $$b_j^{(t)} = \bar{P} _ {N+1,j}^{(t)}$$

2. 取证打分与选择 (Forensic Scoring and Selection, FS)

仅凭时间传输代价无法区分“合法的相机大范围运动”和“生成伪影”。为了解决这种歧义,FS 模块结合了空间的高频先验。真实的相机移动只会移动纹理而不改变频谱;而生成管道(重采样、上采样网络、混合边界)会引入强烈的高频伪影。

步骤 A:高频先验提取 对输入帧 $I_t$ 应用固定的 $3\times3$ 拉普拉斯算子 $\mathcal{L}(\cdot)$,并将其平均池化到 $N$ 个 patch 网格上,得到归一化的空间高频响应代理 $U^{(t)} \in [0, 1]^N$,其中 $U_j^{(t)}$ 代表第 $j$ 个 patch 的高频响应强度。

步骤 B:软与门分数融合 (Soft AND Gate) 第 $t$ 帧中第 $j$ 个 token 的最终取证分数 $s_j^{(t)}$ 被设计为时间异常项和空间调制项的乘积:

$$s_j^{(t)} = \underbrace{(e_j^{(t)} + \lambda _ {birth}b_j^{(t)})} _ {\text{时间异常 (Temporal Anomaly)}} \cdot \underbrace{(1 + \eta _ {forensic}U_j^{(t)})} _ {\text{空间调制 (Spatial Modulation)}}$$

其中,$\lambda _ {birth}$ 用于平衡生成证据和传输代价,$\eta _ {forensic}$ 用于控制高频特征的放大效应。 这种乘法公式实现了一个“软 AND 门”逻辑:只有在时间上具有异常移动/生成,且在空间上具有强高频边缘活动的 token 才能获得高分。它有效剔除了单纯的平移背景或静态的高频物体边缘。

步骤 C:Top-K 物理剪枝 给定一个保留率 $\rho \in (0, 1]$,模型对每一帧中按 $s_j^{(t)}$ 排序的 Top $K = \lfloor \rho N \rfloor$ 个 token 进行物理保留。被选中的压缩序列(长度由原本的 $T(N+1)$ 锐减至 $T(K+1)$)将直接输入到后续的大语言模型解码器中,从而大幅消除 Transformer 层中自注意力的二次方计算开销。


More Tokens are Better but Not Necessary in Forensic Vision-Language Models
https://lijianxiong.space/2026/20260722/
作者
LJX
发布于
2026年7月22日
许可协议