模型后面的层是否无用? 大模型的扩展始终强调深度增加,实证证据表明模型性能随着层数增加而提高——尽管收益递减。早年的深度学习也强调深度比宽度更重要,且深度能提高模型性能。 但是也有不少文章(比如博客之前写过的一些)指出,后面的层会扼杀模型原有的能力。 模型后面的层究竟执行什么样的任务? 这次进行四篇论文的串读。一篇ICLR2025,一篇NIPS workshop,两篇arxiv。 2025-11-06 #深度学习 #大模型
缓解多模态幻觉通过注意力引导的集成解码 (ICLR 2025)《Do You Keep an Eye on What I Ask? Mitigating Multimodal Hallucination via Attention-Guided Ensemble Decoding》 代码 2025-11-05 #深度学习 #多模态 #大模型
大模型天生具有某些能力 (ICLR 2025)两篇串起来阅读。 《MLLMs Know Where to Look: Training-Free Perception of Small Visual Details with Multimodal LLMs》 &《MLLM CAN SEE? DYNAMIC CORRECTION DECODING FOR HALLUCINATION MITIGATION》 2025-11-05 #深度学习 #大模型
AGLA:Mitigating Object Hallucinations in Large Vision-Language Models with Assembly of Global and Local Attention ( CVPR 2025) 引入了一种图像提示匹配方案,该方案从图像中捕获与提示相关的局部特征,从而获得输入图像的增强视图,其中突出显示与提示相关的内容,同时抑制不相关的干扰。 2025-11-05 #深度学习 #大模型
ICT:Image-Object Cross-Level Trusted Intervention for Mitigating Object Hallucination in Large Vision-Language Models (CVPR 2025) 2025-11-04 #深度学习 #大模型
幻觉与越狱的一致性 (ICLR 2026在投) 原标题是《从幻觉到越狱:重新思考大型基础模型的脆弱性》 作者提出一个统一的理论框架,将越狱行为建模为 token 级别的最优化,将幻觉现象建模为注意力级别的最优化。 在此框架下,作者建立了两个关键命题: (1) 相似损失收敛——在优化目标特定输出时,两种漏洞的损失函数表现出相似的收敛特性 (2) 注意力重分配中的梯度一致性——两者均表现出由共享注意力动态驱动的一致梯度 2025-11-03 #深度学习 #大模型
性能提升的幻觉:为什么对比解码无法缓解多模态大模型中的对象幻觉问题? (NIPS 2025) 作者认为,目前的一些对比解码方法在POPE等基准测试上观察到的性能提升是一种假象 ,并非真正解决了幻觉问题。 2025-11-01 #深度学习 #多模态 #大模型
频域特征对多模态大模型的幻觉影响 (arxiv 3月)Mitigating Object Hallucinations in MLLMs via Multi-Frequency Perturbations目前仍缺乏研究探讨视觉特征在频域中对多模态大模型(MLLMs)的作用。甚至尚未有先验工作探索其在 MLLMs 中的物体幻觉现象中的作用。 作者实验,无论“高频”还是“低频”被移除,模型的幻觉比例都会显著增加。这表明这两种信息 2025-10-29 #深度学习 #大模型