Analyzing and Mitigating Object Hallucination: A Training Bias Perspective

(AAAI 2026)

motivation

作者观察到了一个反直觉的现象:模型甚至会在它们预训练或指令微调时见过的图像上产生幻觉。

这一现象引发了核心思考:模型是真的从训练数据中获得了泛化的视觉理解能力,还是仅仅记住了浅层的关联与虚假的训练偏差?。

发现

训练偏差

为了量化评估训练数据对幻觉的影响,作者构建了一个新基准数据集 POPEv2

数据集构造:作者从 LVLMs 常用的训练数据集(MSCOCO 2017)中采样图像,并将图像中的目标物体用黑色图块遮挡,构建出“反事实图像(Counterfactual Images)”。

测试方法:向模型提出二元分类问题,例如“图片中是否有笔记本电脑?”。

测试结果与发现:当前主流模型(如 LLaVA 系列、InternVL2、Qwen2-VL)在处理这些见过的反事实图像时表现挣扎。即使物体被遮挡,模型依然倾向于错误地回答“有(Yes)”。

结论:这一结果表明,模型高度依赖其在训练期间学到的“偏差(Bias)”(例如物体间的共现关系),而不是真实地基于视觉证据进行判断。单纯扩大模型参数规模对解决该问题影响有限,而采用动态分辨率等提升视觉感知能力的策略则更为有效。

定位幻觉瓶颈

为了找出到底是模型中的哪个模块导致了这种训练偏差,作者对模型内部各层(视觉编码器、投影层、Transformer隐藏层)进行了“线性探测(Linear Probing)”实验。

隐藏状态中包含准确的视觉信息:实验发现,利用模型中间层的图像特征或文本特征训练的线性探针,在反事实问题上的分类准确率非常高(大于 95%)。这说明模型内部其实已经准确感知到了物体是否存在。

语言建模头(LM Head)是罪魁祸首:然而,最终负责输出文本的 LM Head 的准确率却大幅下降至 80.79%。LM Head 无法将准确的内部视觉表示转化为忠实的文本输出。

共现偏差的具体表现:在生成描述时,即使图像中没有某个物体(如电视、笔记本电脑),只要图像中出现了与其经常共同出现的物体(如遥控器),LM Head 就会赋予这些不存在物体极高的生成概率。

方法

作者提出了一种轻量且高效的幻觉缓解方法——Obliviate,通过让模型“遗忘”训练偏差来解决问题。

收集偏见序列:首先让 LVLM 在自己的训练数据上重新进行推理生成。将生成的文本与真实的标签进行对比,提取出包含幻觉物体的子句,将其作为偏见数据的代理。

高效的遗忘学习:Obliviate 方法不需要完整微调模型,而仅微调 LM Head(约占总参数的 2%)

损失函数设计

  • 去偏损失(Debiased Loss):对提取出的幻觉子句进行梯度上升,主动降低这些偏见输出的概率,促使模型“遗忘”它们。
  • 自回归损失(Auto-regressive Loss):为了防止模型丧失原本的生成能力,结合了对真实标签输出的标准自回归损失进行正则化。

实验


Analyzing and Mitigating Object Hallucination: A Training Bias Perspective
https://lijianxiong.space/2026/20260722-1/
作者
LJX
发布于
2026年7月22日
许可协议