规模化安全:大型模型与智能体安全的综合调查

中文翻译版。原论文:arXiv:2502.05206;配套项目:Awesome Large Model Safety

摘要

大模型的迅速发展,得益于其通过大规模预训练在学习和泛化方面表现出的卓越能力,重塑了人工智能领域的格局。本综述系统性地回顾了视觉基础模型、大语言模型、视觉-语言预训练模型、视觉-语言模型、扩散模型以及智能体的安全研究,涵盖对抗攻击、数据投毒、后门攻击、越狱与提示注入、能效-延迟攻击、数据与模型提取攻击及相应防御策略,并讨论全面安全评估、可扩展防御与全球协作等开放问题。

关键词:人工智能安全、大模型安全、智能体安全、攻击与防御。

引言

人工智能(AI)已进入大模型时代,典型代表包括视觉基础模型(VFMs)、大型语言模型(LLMs)、视觉-语言预训练(VLP)模型、视觉-语言模型(VLMs)以及图像/视频生成扩散模型(DMs)。 通过在大规模数据集上进行大规模预训练,这些模型在从语言理解、图像生成到复杂问题解决和决策制定的任务中展现出了前所未有的能力。它们理解和生成类人内容(例如文本、图像、音频和视频)的能力已在客户服务、内容创作、医疗保健、教育等领域得到应用,突显了其在商业和社会领域中的变革潜力。

然而,大型模型的部署伴随着重大的挑战和风险。随着这些模型越来越多地融入关键应用,它们在对抗、越狱和后门攻击、数据隐私泄露以及生成有害或误导性内容方面的脆弱性问题引发了更多关注。这些问题带来了重大威胁,包括意外的系统行为、隐私泄露以及有害信息的传播。确保这些模型的安全性至关重要,以防止此类意外后果,维护公众信任,并促进负责任的人工智能使用。面对这些挑战,人工智能安全研究领域已得到扩展,涵盖了多种攻击方法、防御策略和评估基准,旨在识别和减轻大型模型的漏洞。鉴于各种大型模型的安全相关技术的快速发展,我们旨在对这些技术进行全面综述,突出其优势、劣势和不足之处,同时推动研究并促进合作。

调研概览

历年安全技术论文数量

不同大模型类型的论文分布

攻击与防御类型分布

大模型安全研究趋势

本次调查的路线图

表 1:现有调查摘要

现有调查摘要

我们的调查方法结构如下。首先,我们针对特定的模型类型和威胁类型进行了基于关键词的搜索,以识别相关论文。随后,我们手动筛选掉非安全相关及非技术性论文。对于每一篇剩余的论文,通过分析其情景和攻击/防御类型,对其提出的方法或框架进行分类,并分配到相应的类别和子类别中。

总共,我们审查了 574 篇技术论文,其在年份、模型类型以及攻击/防御策略上的分布如图 1 所示。如图所示,自 2023 年 ChatGPT 发布以来,大模型的安全研究显著增长。在模型类型中,大模型(LLMs)、扩散模型(DMs)和智能体(Agents)最受关注,占所调研论文的 71.32%。在攻击类型方面,越狱对抗后门攻击得到了最广泛的研究。在防御方面,越狱防御受到最高关注,其次是对抗防御

图 2 展示了不同模型类型与攻击/防御类别之间的时序趋势交叉视图,对所审查的工作进行了详细分解。值得注意的是,攻击研究占所研究内容的 $\sim$ 60%。在防御方面,尽管防御研究仅占 $\sim$ 40%,凸显出亟需更多关注防御策略的重大差距。本综述的整体结构如图 3 所示。

与现有综述的差异。 大模型安全是一个快速发展的领域,已有若干综述致力于推动该领域的研究。最近,Slattery 等人 [557] 提出了一个包含各类风险的系统化分类框架的 AI 风险框架。相比之下,我们的重点在于技术层面,特别是文献中提出的攻击与防御技术。 表 1 总结了我们识别出的技术综述,每篇综述均聚焦于少数几类模型或威胁类别(例如,大模型、视觉语言模型、智能体,或越狱攻击/防御)。 相较于这些工作,我们的综述在范围上更为广泛,涵盖了更广泛的模型类型和威胁,并提供了更高层次的视角,关注的是总体方法论而非具体的细节技术。

视觉基金会模型安全

本节综述了两种类型的VFMs的安全研究:预训练视觉Transformer (ViTs) [558] 和 Segment Anything Model (SAM) [559]。 我们重点关注ViTs和SAM,因为它们是最广泛部署的VFMs之一,并且在最近的安全研究中引起了广泛关注。

表 2:ViT 与 SAM 的攻击和防御总结

ViT 与 SAM 的攻击和防御总结

ViTs的攻击与防御

预训练的ViT被广泛用作各种下游任务的主干网络,通过高效的适应和微调经常达到最先进性能。与传统CNN不同,ViT将图像处理为分块的token序列,使其能够更好地捕捉空间依赖性。然而,这种基于分块的机制也带来了独特的安全问题和鲁棒性挑战。本节通过回顾与ViT相关的安全研究来探讨这些问题,包括对抗攻击、后门和污染攻击及其相应的防御策略。表 2总结了所调查的攻击和防御方法,以及常用的数据集。

对抗攻击

对抗攻击可以分为白盒攻击黑盒攻击,这取决于攻击者是否能够完全访问目标模型。根据攻击策略,白盒攻击可以进一步分为1)补丁攻击,2)位置嵌入攻击和3)注意力攻击,而黑盒攻击可以总结为1)基于迁移的攻击和2)基于查询的攻击

白盒攻击

块攻击利用ViTs的模块化结构,通过在输入数据的特定块中引入有针对性的扰动,旨在操纵其推理过程。Joshi等人 [17]提出了一种基于块稀疏性的对抗token攻击方法,用于评估ViTs对token级别扰动的脆弱性。 在此基础上,Patch-Fool[1]提出了一种对抗攻击框架,通过扰动图像的单个块来针对自注意力模块,从而操纵注意力得分。 与现有方法不同,SlowFormer [2]引入了一种通用的对抗块,可应用于任意图像,在保持模型准确率的同时增加计算和能耗成本。

位置嵌入攻击 旨在攻击Transformer中的token的空间或顺序位置。例如,PE-Attack [3] 通过周期性操作、线性失真和优化嵌入失真来破坏其编码位置信息的能力,从而探索位置嵌入对对抗扰动的常见漏洞。

注意力攻击 针对ViTs的自注意力模块中的漏洞。注意力欺骗 [4] 操纵点积相似性,将查询重定向到对抗性键token,暴露模型对对抗性补丁的敏感性。同样,AAS [5] 通过优化预Softmax输出的缩放因子来缓解ViTs中的梯度掩码,提高攻击的有效性。

黑盒攻击

基于迁移的攻击 首先使用完全可访问的代理模型生成对抗样本,随后将这些样本迁移到攻击黑盒目标ViT。在此背景下,我们首先回顾专为ViT架构设计的攻击方法。 SE-TR [6] 通过在模型集成上优化扰动来增强对抗迁移性。 ATA [7] 通过策略性激活不确定的注意力并扰动ViT中的敏感嵌入来实现攻击。 LPM[9] 通过块级优化的二值掩码缓解对模型特定判别区域的过拟合。 Chen等 [18] 提出了归纳偏置攻击(IBA),旨在抑制ViT中的独特偏置,并针对共享的归纳偏置进行攻击。 TGR [11] 减少了内部块中反向传播梯度的方差。 VDC [12] 在深层注意力图与MLP块之间引入虚拟稠密连接,以促进梯度反向传播。 FDAP [13] 通过减少特征空间中的高频分量来利用特征坍缩。 CRFA [16] 使用近似注意力图仅破坏最关键的图像区域。 SASD-WS [15] 通过尖锐感知自蒸馏平坦化源模型的损失曲面,并通过权重缩放近似剪枝模型的集成,以提升目标对抗迁移性。 FPR [560] 通过改进前向传播而非反向梯度来提高ViT上的对抗迁移性。其包含两个组件:(1) 注意力图多样化(AMD),通过对注意力图施加可控随机性以实现多样性,缓解过拟合并隐式诱导梯度消失;(2) 动量token嵌入(MTE),通过累积跨迭代的历史嵌入来稳定token嵌入更新。

其他策略适用于ViTs和CNNs,在黑盒设置中确保更广泛的适用性。 Wei等人[8, 19] 提出了一种双重攻击框架,以提高ViTs和CNNs之间的可迁移性:1)不关注(PNA)攻击,在反向传播中跳过注意力的梯度,以及2)PatchOut攻击,在每次迭代中随机扰动图像块的子集。 MIG[10] 使用集成梯度和基于动量的更新来精确地针对与模型无关的关键区域,从而提高ViTs和CNNs之间的可迁移性。

基于查询的攻击 通过查询黑盒模型并利用模型响应来估计对抗梯度生成对抗样本。目标是以最少的查询次数实现成功的攻击。根据模型响应的类型,基于查询的攻击可以进一步分为基于得分的攻击,其中模型返回一个概率向量,以及基于决策的攻击,其中模型仅提供前k个类别。基于决策的攻击通常从较大的随机噪声开始(以首先实现误分类),然后逐渐找到更小的噪声同时保持误分类。 为了提高ViTs中对抗噪声搜索过程的效率,PAR [14] 引入了一种由噪声幅度和敏感性掩码引导的粗到细的块搜索方法,以考虑ViTs的结构特性并减轻非重叠块的负面影响。

对抗防御

ViTs的对抗防御遵循四种主要方法:1) 对抗训练,通过最小最大最优化在对抗样本上训练ViTs以提高其鲁棒性;2) 对抗检测,通过检测输入中的异常或恶意模式来识别和缓解对抗攻击;3) 鲁棒架构,通过修改和优化ViTs的架构(例如自注意力模块)来提高其对抗对抗攻击的弹性;以及4) 对抗净化,通过预处理输入(例如噪声注入、降噪或其他变换)在推理前去除潜在的对抗扰动。

对抗训练被广泛认为是对抗防御最有效的方法;然而,它伴随着较高的计算成本。为了解决ViTs上的这一问题,AGAT [20] 引入了一种动态注意力引导的丢弃策略,通过在每一层有选择地移除某些块嵌入来加速训练过程。这在保持鲁棒性的同时减少了计算开销,尤其是在大型数据集如ImageNet上。由于计算成本较高,针对ViTs的对抗训练研究相对有限。 ARD-PRM [28] 通过在注意力块中随机丢弃梯度并在训练期间对块扰动进行掩码来提高对抗鲁棒性。

对抗检测方法对于ViTs主要利用两个关键特征,即基于块的推理和活性值特征,以检测和缓解对抗样本。 Li等 [21]提出了块残迹的概念,在ViTs中的块划分过程中出现的对抗样本异常。他们使用了跨块相邻像素之间步骤变化的统计指标,并开发了一个二元回归分类器来检测对抗样本。另外,ARMOR [23]通过扫描特定层中不寻常的高列得分来识别对抗块,并使用平均图像对其进行掩码以减少其影响。 ViTGuard [22]则采用掩码自编码器通过分析注意力图和CLS token表示来检测块攻击。随着更多攻击的出现,迫切需要一个统一的检测框架,能够处理所有类型的对抗样本。

鲁棒性架构 方法专注于为 ViT 设计更具对抗鲁棒性的注意力模块。 例如,平滑注意力 [27] 在 Softmax 函数中采用温度缩放,以防止任何单个图像块主导注意力,从而在各图像块间实现注意力的均衡分布。 ReiT [32] 通过 II-ReSA 模块将对抗训练与随机化相结合,优化随机纠缠的 token,降低对抗相似度并增强鲁棒性。 TAP [29] 通过引入感知 token 的平均池化和注意力多样化损失来解决 token 过度聚焦问题,该方法融合局部邻域信息并降低注意力向量间的余弦相似度。 FViTs [31] 通过稳定自注意力中的 top-k 索引,并结合去噪扩散平滑与高斯噪声来强化预测鲁棒性,提升解释的一致性。 RSPC [30] 通过破坏最敏感的图像块,并对干净输入与受损输入之间的中间特征进行对齐,以稳定注意力机制,缓解潜在漏洞。总体而言,这些进展凸显了注意力机制在提升 ViT 对抗鲁棒性方面的关键作用。 SATA [561] 在无需重新训练的情况下增强 ViT 模型的鲁棒性,通过在注意力层与前馈网络(FFN)之间注入基于空间自相关性的模块实现。该方法根据空间自相关得分分割 token,选择性地合并高/低得分 token 再进入 FFN,减少冗余并改善特征聚合;残余 token 后续被连结以保留信息,从而有效抵御对抗攻击和数据污染输入。

对抗净化 指的是一种与模型无关的输入处理技术,广泛适用于各种架构,包括但不限于ViTs。 DiffPure [33] 引入了一个框架,其中对抗图像通过前向随机微分方程(SDE)过程进行噪声注入,然后使用预训练的扩散模型进行降噪。 CGDMP [24] 通过优化前向过程的噪声级别并利用对比损失梯度引导降噪过程来改进这一方法,实现了针对ViTs的改进净化。 ADBM [25] 强调了扩散对抗和干净样本之间的差异,提出了一种直接连接干净和扩散对抗分布的方法。 尽管这些方法专注于ViTs,其他方法则展示了更广泛的适用性,例如各种视觉模型,如CNNs。 Purify++[34] 通过改进的扩散模型增强了DiffPure, DifFilter[35] 将噪声尺度扩展以更好地保留语义,而 MimicDiffusion[36] 在反向扩散过程中减轻了对抗影响。 为了提高效率, OSCP[26] 和 LightPure[37] 分别提出了单步和实时净化方法。 LoRID[38] 引入了一种基于马尔可夫的鲁棒净化方法。 这些方法补充了与ViT相关的研究,并突显了对抗净化领域的多样化进展。

后门攻击

后门可以通过数据污染、训练操纵或参数编辑注入到受害模型中,大多数现有的ViT攻击是基于数据污染的。 我们将这些攻击分为四类:1) 块级攻击,2) token级攻击,以及 3) 多触发器攻击,它们利用了ViT特有的数据处理特性,以及 4) 无数据攻击,它们利用了ViT的固有机制。

块级攻击 主要利用ViT将图像处理为离散块的特性,在块级别植入触发器。例如,BadViT [39] 引入了一个通用的块级触发器,只需要少量数据就可以将模型的关注从分类相关块转移到对抗触发器上。 TrojViT [40] 通过利用块显著性排名、注意力目标损失函数和参数蒸馏来改进此方法,以最小化嵌入后门所需的比特翻转。

令牌级攻击 针对ViTs的分词层。SWARM [41] 引入了一种可切换的后门机制,其特点是具有一个”切换令牌”,可以在良性行为和对抗行为之间动态切换,确保高攻击成功率的同时在干净环境中保持功能。

多触发器攻击 使用多个后门触发器以并行、顺序或混合配置来污染受害数据集。 MTBAs [43] 利用这些多个触发器来引发共存、覆盖和交叉激活效应,显著降低现有防御机制的有效性。

无数据攻击 消除了对原始训练数据集的需求。使用替代数据集,DBIA [42] 生成在 ViTs 中最大化注意力的通用触发器。这些触发器通过 PGD [563] 进行最小参数调整的微调,从而实现高效且资源轻量的后门注入。

后门防御

针对ViTs的后门防御旨在识别并破坏(或移除)触发模式与目标类别之间的相关系数,同时保持模型准确率。 两种有代表性的防御策略是:1) 块处理,通过破坏图像块的完整性来防止触发激活,和 2) 图像块遮挡,利用基于可解释性的机制来遮盖并中和后门触发的影响。

块处理策略破坏块的完整性以中和触发器。 Doan等人 [44]发现,在位置编码之前,ViTs的干净数据准确率和攻击成功率对块变换的响应不同,并通过随机丢弃或打乱图像的块来提出一种有效的防御方法,以对抗基于块和混合的后门攻击。 图像块利用可解释性来识别和中和触发器。 Subramanya等人 [46]表明,ViTs可以使用注意力图来定位后门触发器,并提出了一种在推理过程中动态掩码潜在触发区域的防御机制。 在后续工作中,Subramanya等人 [45]提出将触发器中和整合到训练阶段,以提高ViTs对后门攻击的鲁棒性。 虽然这两种方法很有前景,但该领域需要一个综合的防御框架,将非ViT防御与ViT特性相结合,并统一包括后门检测、触发器反转和后门移除在内的多个防御任务,如[564]所做的尝试。

数据集

数据集在开发和评估攻击和防御方法中起着关键作用。表 2 总结了对抗和后门研究中使用的数据集。

对抗研究的数据集 如表 2所示,对抗研究主要在ImageNet上进行。虽然攻击在各种数据集如CIFAR-10/100、Food-101和GLUE上进行了测试,但防御措施主要局限于ImageNet和CIFAR-10/100。这种不平衡揭示了对抗研究中的一个关键问题:攻击更加通用,而防御在不同数据集上的泛化能力较差。

后门研究的数据集 后门研究主要在ImageNet和CIFAR-10/100数据集上进行。一些攻击,如DBIA和SWARM,扩展到特定领域的数据集,如GTSRB和VGGFace,而防御措施,包括PatchDrop,通常仅限于几个基准数据集。这种狭窄的焦点降低了它们在现实世界中的适用性。 尽管后门防御正朝着鲁棒推理技术转变,但它们通常针对特定的攻击模式,限制了其泛化能力。为了解决这个问题,需要在更广泛的数据集上测试自适应防御策略,以有效应对后门威胁的演变特性。

SAM的攻击与防御

SAM 是一个基础模型,用于图像分割,由三个主要组件组成:基于 ViT 的图像编码器、提示编码器和掩码解码器。图像编码器将高分辨率图像转换为嵌入,而提示编码器将各种输入模态转换为 token 嵌入。掩码解码器使用两层 Transformer 架构结合这些嵌入以生成分割掩码。 由于其复杂的结构,针对 SAM 的攻击和防御与针对 CNNs 开发的攻击和防御有很大不同。这些独特的挑战源于 SAM 模块化和相互连接的设计,其中某一组件中的漏洞可能会传播到其他组件,从而需要针对攻击和防御的专门策略。 本节系统地回顾了与 SAM 相关的对抗攻击、后门 & 污染攻击以及对抗防御策略,如表 2 所总结。

对抗攻击

对抗攻击可以分为:(1) 白盒攻击,例如 提示无关攻击,以及 (2) 黑盒攻击,后者可以进一步分为 通用攻击迁移基于攻击。每一类都采用不同的策略来破坏分割性能。

白盒攻击

提示无关攻击 是一种白盒攻击,能够在不依赖特定提示的情况下干扰SAM的分割,通过使用 提示级特征级 的扰动来实现对不同输入的通用性。

对于提示级攻击,Shen等人 [47] 提出了一种基于网格的策略,生成对抗性扰动,无论点击位置如何都能破坏分割效果。

对于特征级攻击,Croce等人 [48] 对图像编码器的特征进行扰动,以扭曲空间嵌入,从而破坏SAM的分割完整性。

黑盒攻击

通用攻击 生成的 UAPs [565] 可以在任意提示下持续干扰 SAM。Han 等人 [53] 利用对比学习优化 UAPs,通过加剧特征错位来提升攻击效果。 DarkSAM [54] 则引入了一种混合空频框架,结合语义解耦与纹理扭曲来生成通用扰动。

基于迁移的攻击 利用SAM中的可迁移表示生成在不同模型和任务中仍然具有对抗性的扰动。 PATA++[50] 通过使用正则化损失来突出图像编码器中的关键特征,从而提高迁移性,减少对特定提示数据的依赖。 Attack-SAM[49] 使用ClipMSE损失专注于掩码移除,优化空间和语义一致性以提高跨任务迁移性。 UMI-GRAT [52] 采用两步过程:首先使用替代模型生成可泛化的扰动,然后应用梯度鲁棒损失以提高跨模型迁移性。 除了设计新的损失函数外,还可以通过变换技术的最优化来提高迁移性。 这包括 T-RA [47],它通过应用频谱变换生成会降低SAM变体分割性能的对抗扰动,从而提高跨模型迁移性,以及 UAD [51],它通过两阶段过程对图像进行变形,并将特征与变形后的目标对齐来生成对抗样本。

对抗防御

针对SAM的对抗防御目前仍有限,现有方法主要集中在对抗调优上,即将对抗训练融入SAM的提示调优过程中。例如,ASAM [55] 利用稳定扩散模型在低维流形上通过基于扩散模型的调优生成逼真的对抗样本。随后,ControlNet [566] 被用于引导重投影过程,确保生成的样本与原始掩码标注一致。最后,使用这些对抗样本对SAM进行微调。RobustSAM [562] 通过奇异值分解(SVD)仅调整SAM卷积层中的512个奇异值,有效改变特征分布,从而抵御对抗攻击。这种少量参数的方法在计算开销极小的情况下实现了良好的鲁棒性–准确率权衡。

后门攻击与中毒攻击

针对SAM的后门攻击和中毒攻击仍未得到充分研究。在此,我们回顾一种利用可感知视觉触发器来破坏SAM的后门攻击,以及一种利用带有不可感知噪声的不可学习示例[567]来保护未经授权的图像数据不被分割模型利用的中毒攻击。 BadSAM [56]是一种针对SAM的后门攻击,它在模型的适应阶段嵌入视觉触发器,植入后门,使攻击者能够使用特定输入操纵模型的输出。具体而言,该攻击向SAM引入MLP层,并通过SAM-Adapter [568]将后门触发器注入这些层。 UnSeg [57]是一种针对SAM的旨在实现良性目的(即数据保护)的数据中毒攻击。它基于预训练的SAM,利用双层优化框架微调一个通用的不可学习噪声生成器。这使得生成器能够高效地生成中毒(受保护)样本,有效地防止分割模型从受保护数据中学习,从而防止个人信息被未经授权地利用。

数据集

如表 2 所示,用于 SAM 安全性研究的数据集与通用分割任务中通常使用的数据集 [569, 570] 略有不同。 在 攻击研究 方面,SA-1B 数据集及其子集 [559] 是评估对抗攻击 [48, 53, 51, 47, 49, 50] 时最常使用的数据集。 此外,DarkSAM 在 Cityscapes [571]、COCO [572] 和 ADE20k [573] 等数据集上进行了评估;而面向与 SAM 相关的下游任务 [574] 的 UMI-GRAT,则在 CT 扫描和 ISTD 等医学数据集,以及 COD10K、CAMO 和 CHAME 等伪装数据集上进行了测试。对于后门攻击,BadSAM 使用 CAMO 数据集 [574] 进行了评估。在数据投毒场景中,UnSeg [57] 在包括 COCO、Cityscapes、ADE20k、WHU 以及 Lung 和 Kvasir-seg 等医学数据集在内的共 10 个数据集上进行了评估。 在 防御研究 方面,ASAM [55] 是目前唯一应用于 SAM 的防御方法。它在若干图像分布比 SA-1B 更为多样的数据集(包括 ADE20k、LVIS、COCO 等)上进行了评估,并以平均交并比(mIoU)作为评估指标。

表 3:大语言模型攻击与防御总结(一)

大语言模型攻击与防御总结(一)

大型语言模型安全

大语言模型是强大的语言模型,擅长生成类似人类的文本、翻译语言、生成创意内容以及回答各种各样的问题 [575, 576]。它们已被迅速应用于会话智能体、自动化代码生成和科学研究等应用中。然而,这种广泛的实用性也带来了重大的漏洞,潜在的对手可以利用这些漏洞。 本节综述了当前的大语言模型安全研究现状。我们考察了一系列对抗行为,包括越狱、提示注入、后门、污染、模型提取、数据提取和能耗-延迟攻击。此类攻击可以操纵输出、绕过安全措施、泄露敏感信息并破坏服务,从而威胁系统的完整性、保密性和可用性。我们还回顾了最先进的对齐策略和防御技术,旨在减轻这些风险。表 3 和 4 总结了这些工作的细节。

对抗攻击

对抗攻击旨在通过细微地修改输入文本,误导目标模型生成错误的响应(无论是否为有目标攻击或无目标攻击)。 我们根据攻击者能否访问模型内部,将这些攻击分为 白盒攻击黑盒攻击

白盒攻击

白盒攻击假设攻击者完全了解大语言模型的架构、参数和梯度。这使得可以通过直接针对模型的预测进行优化来构建高度有效的对抗样本。这些攻击通常可以分为两个层次:1) 字符级攻击2) 单词级攻击,主要区别在于它们的有效性和语义隐蔽性。

字符级攻击 在字符层面引入细微的修改,例如拼写错误、打字错误以及插入视觉相似或不可见的字符(例如同形异义字符 [58])。这些攻击利用模型对微小字符变化的敏感性,而这些变化通常对人类来说难以察觉,从而在保持原始语义的同时实现高度隐蔽。

词级攻击 通过替换特定词语来修改输入文本。例如,TextFooler [59] 和 BERT-Attack [60] 使用 同义词置换 来生成对抗样本,同时保持语义相似度。其他方法,如 GBDA [61] 和 GRADOBSTINATE [63],利用梯度信息来识别语义相似的 词语置换,以最大化成功攻击的似然性。此外,目标词置换 可以实现针对特定任务或语言环境的攻击。例如,[62] 探索了对命名实体识别的目标攻击,而 [64] 将词语置换攻击适应到了中文语言中。

黑盒攻击

黑盒攻击假设攻击者对目标大语言模型的参数了解有限或完全不了解,并且仅通过API查询与模型进行交互。与白盒攻击不同,黑盒攻击采用间接和适应性的策略来利用模型的漏洞。这些攻击通常操纵输入提示,而不是修改核心文本。我们进一步将现有的黑盒攻击分为四类:1) 上下文攻击,2) 诱导攻击,3) 大语言模型辅助攻击,和 4) 表格攻击

上下文攻击 利用在上下文学习中使用的示范例子来引入对抗行为,使模型容易受到污染提示的影响。AdvICL [65] 和 可转移的-advICL 操纵这些示范例子以暴露这种脆弱性,突显模型对污染的上下文数据的易感性。

诱导攻击 依赖于精心设计的提示,以诱导模型生成有害或不期望的输出,通常可以绕过其内置的安全机制。这些攻击通过设计欺骗性的输入提示来生成对抗性响应。例如,Liu 等人 [66] 分析了这样的提示如何导致模型生成危险的输出,从而有效规避了旨在防止此类行为的安全措施。

LLM辅助攻击 利用LLM来实现攻击算法或策略,有效地将模型变成进行对抗性动作的工具。这种方法突出了LLM协助攻击者设计和执行攻击的能力。例如,Carlini [577]展示了GPT-4可以通过逐步提示来设计攻击算法,突显了将LLM用作研究助理以自动化对抗过程的潜力。

表格攻击 通过利用列和标注的结构来针对表格数据注入对抗行为。Koleva 等人 [67] 提出了一种实体交换攻击,该攻击专门针对表格数据集中的列类型标注。这种攻击利用了训练集到测试集的实体泄露,从而创建了更加真实和有效的对抗场景。

对抗防御

对抗防御对于确保大语言模型在现实应用中的安全性、可靠性和可信度至关重要。现有的大语言模型对抗防御策略可以根据其主要重点分为两类:1) 对抗检测2) 鲁棒推理

对抗检测

对抗检测方法旨在识别并标记可能的对抗性输入,以免它们影响模型的输出。其目标是实现一种过滤机制,能够区分良性提示和恶意提示。

输入过滤 大多数针对LLM的对抗检测方法是输入过滤技术,这些技术基于统计或结构异常来识别并拒绝对抗性文本。例如,Jain等人 [68] 使用困惑度来检测对抗性提示,因为这些提示在由校准良好的语言模型评估时通常表现出更高的困惑度,表明与自然语言模式的偏离。通过设置困惑度阈值,可以过滤掉此类输入。另一种方法,擦除与检查 [69],通过迭代擦除输入的部分内容并检查输出的一致性来确保鲁棒性。输出的显著变化表明可能存在对抗性操控。 输入过滤方法提供了一种轻量级的第一道防线,但其有效性取决于所选特征和对抗攻击的复杂性,如果设计得当,这些防御可能会被绕过。

稳健推理

鲁棒推理方法旨在通过修改其内部机制或训练,使模型本身对对抗攻击具有抵抗力。一种方法,电路中断 [70],针对推理过程中的特定活性值模式,无需重新训练即可中和有害输出。虽然鲁棒推理增强了对自适应攻击的抵抗力,但通常会增加计算成本,且其效果因模型架构和攻击类型而异。

越狱攻击

与简单导致受害大模型生成错误答案的对抗攻击不同,越狱攻击通过手工或自动生成的越狱提示绕过内置安全策略/对齐,诱使大模型生成不当内容($e.g.$,有害或欺骗性内容)。目前,大多数越狱攻击针对大模型即服务场景,遵循黑盒威胁模型,攻击者无法访问模型内部。

手工构造的攻击

手工构造的攻击涉及设计对抗性提示,以利用目标大语言模型中的特定漏洞。其目的是构造单词/短语组合或结构,以绕过模型的安全过滤器,同时仍然传达有害请求。

基于场景的伪装 将恶意查询隐藏在复杂的场景之中,例如角色扮演或解谜游戏,以掩盖其有害意图。例如,Li 等人 [74] 指示大模型采用可能生成有害内容的角色身份,而 SMEA [76] 则将大模型置于权威人物的下属角色中。Easyjailbreak [75] 将有害查询置于假设性语境中,Puzzler [80] 则将这些查询嵌入谜题中,其解法对应于有害输出。 借鉴心理测量学原理,Wen 等人 [81] 提出了诸如伪装、欺骗和教学等攻击方法,通过构建特定的心理场景来激发隐性偏见。 基于分析的越狱(ABJ) [82] 将有害查询转化为中立的分析性提示,通过操纵模型的推理链诱导出不安全的回答。 其他研究也利用了心理学概念,采用伪装、欺骗和教学等技术,从心理测量学角度揭示大模型中的隐性偏见 [81]。 注意力转移 通过引入语言复杂性,将大模型的关注点从恶意意图上转移。Jailbroken [73] 使用代码切换和异常句式,Tastle [77] 调整语气,StructuralSleight [78] 改变句子结构以破坏理解。 此外,Shen 等人 [92] 收集了用户在社交媒体(如 Reddit 和 Discord)上分享的真实越狱提示,并研究了它们对大模型的有效性。

基于编码的攻击 利用大语言模型在处理稀有编码方案方面的局限性,例如低资源语言和加密。这些攻击以 Base64 [73] 或低资源语言 [71] 等格式对恶意查询进行编码,或使用自定义加密方法如密码 [72] 和 CodeChameleon [79] 来隐藏有害内容。

自动化攻击

与手工制作的攻击不同,自动化攻击旨在自主发现越狱提示。这些攻击要么使用黑盒最优化来搜索最佳提示,要么利用大语言模型生成和优化它们。

提示最优化 利用最优化算法迭代优化提示,以实现更高的成功率。对于黑盒方法,AutoDAN [83] 采用遗传算法,GPTFuzzer [84] 使用基于变异和生成的模糊测试技术,而 FuzzLLM [88] 在自动化模糊测试框架内生成语义连贯的提示。 I-FSJ [96] 将特殊 token 注入 few-shot 示范中,并使用示范级别的随机搜索来优化提示,在对齐模型及其防御机制上实现了较高的攻击成功率。 对于白盒方法,最具代表性的是 GCG [93],其引入了一种贪心坐标梯度算法来搜索对抗后缀,有效攻破了对齐的大模型。 I-GCG [94] 进一步通过多样化的目标模板和自动多坐标更新策略改进 GCG,实现了接近完美的攻击成功率。 将关注点从最优化算法转向训练数据,POUGH [95] 提出一种语义引导的提示采样与秩排序策略,从而提升了生成的对抗后缀的效率与泛化能力。

大语言模型辅助攻击 使用一个对抗性大语言模型来帮助生成越狱提示。Perez 等人 [90] 探索了基于模型的红队测试,发现通过强化学习微调的大语言模型可以生成更有效的对抗性提示,尽管多样性有限。CRT [91] 通过最小化 SelfBLEU 得分和余弦相似度来提高提示的多样性。PAIR [85] 使用多轮查询与攻击者大语言模型来迭代优化越狱提示。基于 PAIR,Robey 等人 [578] 提出了 ROBOPAIR,该方法针对大语言模型控制的机器人,导致有害的物理动作。类似地,ECLIPSE [98] 利用攻击者大语言模型来识别类似于 GCG 的对抗性后缀,从而自动化提示最优化过程。为了提高提示的可迁移性,Masterkey [86] 训练对抗性大语言模型以攻击多个模型。此外,弱到强越狱 [97] 提出了一种新颖的攻击方法,其中较弱的、不安全的模型引导较强的、对齐的模型生成有害内容,在计算成本极低的情况下实现了高成功率。

基于微调的攻击

基于微调的攻击通过在小型恶意数据集上对大模型进行微调,破坏其安全对齐性,从而将攻击面从推理阶段的提示扩展到模型定制阶段。 与基于提示的攻击不同,该方法直接修改模型权重,植入有害行为,而非仅仅绕过输入过滤机制。 一个典型的例子是 Qi 等人 [99] 的工作,他们证明仅使用十个对抗样本对大模型进行微调,即可破坏其安全对齐性。他们的研究进一步揭示了一种微妙的风险:即使在良性且以实用性为导向的数据集上进行微调,也可能无意中削弱安全对齐性,凸显了其内在脆弱性。

为缓解这一威胁,服务提供商可部署护栏模型,以过滤用户提供的微调数据中的有害样本。然而,Huang 等人 [100] 表明,此类防御措施可能被绕过。他们提出的攻击方法 Virus 采用双目标最优化,构造出的微调数据既能被护栏模型分类为良性,又能通过保持与原始有害数据的梯度相似度,高效地破坏安全对齐。这种持续存在的对抗动态,体现了攻击者与防御者在微调流水线中不断演变的猫鼠游戏。

越狱防御措施

我们现介绍针对黑盒大模型的相应防御机制,以应对越狱攻击。根据干预阶段的不同,现有防御方法可划分为四类:输入防御输出防御集成防御以及针对微调攻击的防御

输入防御

输入防御方法专注于对输入提示进行预处理,以减少其有害内容。当前技术包括改写翻译

输入重述 通过改写或净化来隐藏提示中的恶意意图。例如,SmoothLLM [101] 使用随机采样对提示进行扰动,而 SemanticSmooth [102] 则寻找语义相似且安全的替代方案。除了在提示层面的修改外,SelfDefend [103] 在 token 层面执行扰动,通过移除困惑度较高的对抗性 token 来实现。另一方面,IBProtector [104] 则基于信息瓶颈原理对编码后的输入进行扰动。

除了推理时的修改,还有多种方法可在训练过程中提升模型的内在鲁棒性。例如,PEARL [105] 采用分布鲁棒最优化框架,对模型进行对抗性训练,以应对上下文示例中最坏情况下的排列组合,从而增强其对基于输入顺序攻击的抵抗力。

类似地,VAA [106] 通过识别容易遗忘的对齐数据子集,提高对有害微调的鲁棒性,并应用组分布鲁棒最优化以确保学习的均衡性。

输入翻译 采用跨语言变换来缓解越狱攻击。例如,Wang 等人 [107] 提出,如果目标大模型拒绝原始提示的反向翻译版本,则拒绝响应,其假设是反向翻译能够揭示提示的潜在意图。类似地,RTT [108] 被设计用于对抗对大模型的社会工程攻击。它通过将输入提示翻译成一种或多种中间语言,再翻译回原始语言,从而破坏原始表述中嵌入的潜在对抗意图。

输入过滤 会拒绝被识别为恶意的查询。例如,CurvaLID [109] 通过分析其文本嵌入的几何差异来检测对抗性提示。由于它仅在输入提示上操作且不依赖于潜在的大模型,CurvaLID 能够为不同大模型提供通用保护。

输出防御

输出防御方法监控大语言模型生成的输出,以识别有害内容,并在检测到不安全输出时触发拒绝机制。

输出过滤 检查大语言模型的输出,并选择性地阻止或修改不安全的响应。该过程依赖于预训练分类器提供的判断得分,或大语言模型自身的内部信号(例如,损失曲面)。例如,APS [110] 和 DPP [111] 使用安全分类器来识别不安全输出,而 梯度护腕(Gradient Cuff) [112] 则分析大语言模型内部的拒绝损失函数,以区分良性与恶意查询。

同样地,通过分析模型的内部状态,活性值边界防御(Activation Boundary Defense, ABD) [113] 在预定义的安全边界内限制有害的活性值,以防止越狱攻击。

LEGILIMENS [114] 在推理过程中从主机大语言模型的内部状态中提取概念特征,并采用轻量级分类器实现高效的内容审核。换位思考提示(Perspective-taking prompting, PET) [579] 是一种有效的方法,可通过大语言模型自身的知识和观点对其输出内容进行调控,而无需对该模型进行微调。

输出重复 通过观察 LLM 可以一致地重复其无害输出来检测有害内容。 PARDEN [116] 通过提示 LLM 重复其输出来识别不一致之处。如果模型无法准确再现其响应,特别是对于有害查询,可能表明存在潜在的越狱行为。

集成防御

集成防御结合多个模型或防御机制以提高性能和鲁棒性。其理念是不同的模型和防御措施可以抵消各自的弱点,从而实现更高的整体安全性。

多模型集成 结合多个大语言模型的推理结果以创建更强大的系统。例如,MTD [115] 通过动态利用多样化的大语言模型来提高大语言模型的安全性。而不是依赖单一模型,MTD 通过分析多个模型的输出来选择最安全和最相关的结果。

多防御集成 集成多种防御策略以增强对各种攻击的鲁棒性。例如,AutoDefense [117] 引入了一个结合输入和输出防御的集成框架,以提高有效性。MoGU [118] 使用动态路由机制,根据输入查询平衡安全大语言模型和可用大语言模型的贡献,有效结合重述和过滤。

对抗微调攻击的防御措施

针对有害微调的防御措施可根据干预阶段进行分类:对齐阶段防御微调阶段防御,或微调后阶段防御

对齐阶段防御旨在微调前强化模型,提升对恶意更新的抵御能力。例如,疫苗 [119] 引入了一种扰动感知的对齐机制,通过向模型嵌入中注入精心设计的扰动,以抵抗有害的嵌入漂移。在此基础上,定向疫苗(T-Vaccine) [120] 通过仅对由梯度范数识别出的安全关键层进行选择性扰动,提升了效率。助推器 [121] 将有害扰动视为对齐退化的原因,并引入正则化项,以减缓模拟恶意更新后有害损失的下降速率。

微调阶段防御 通过修改微调过程,在适应下游任务的同时保持安全对齐。Lisa [122] 采用双状态最优化(BSO),在对齐数据和用户微调数据之间交替进行,并引入近端项以约束状态漂移,确保收敛性和稳定性。

微调后阶段防御 用于恢复已受损模型的安全性。解药 [123] 在微调后采用一次性的剪枝步骤,以消除导致有害内容的权重,且对微调超参数保持无关性。类似地,万能药 [124] 引入了一种优化的、自适应的权重扰动,以缓解有害行为,同时不损害下游性能。这两种方法均依赖于识别并中和攻击过程中受影响的参数。

提示注入攻击

提示注入攻击通过在原本无害的提示中注入恶意指令来操纵LLM生成意外输出。如第3.3节所述,我们专注于LLM-as-a-Service系统中的黑盒提示注入攻击,并将其分为两类:手工构造自动化攻击。

手工构造的攻击

手工构造的攻击需要专家知识来设计能够利用大语言模型漏洞的注入提示。这些攻击高度依赖人类直觉。PROMPTINJECT [125] 和 HOUYI [126] 展示了攻击者如何通过附加恶意命令或使用忽略上下文的提示来操控大语言模型,从而泄露敏感信息。Greshake 等人 [127] 提出了一种针对检索增强型大语言模型的间接提示注入攻击,用于信息收集、欺诈和内容操纵,方法是将恶意提示注入外部数据源。 Liu 等人 [129] 对提示注入攻击和防御进行了形式化,引入了一种组合攻击方法,并建立了评估大语言模型和任务中攻击和防御的基准。 Ye 等人 [130] 探索了学术同行评审中的大语言模型漏洞,揭示了显性和隐性提示注入的风险。显性攻击涉及在论文中嵌入不可见文本,以操纵大语言模型生成过于积极的评审。隐性攻击利用大语言模型倾向于过分强调已披露的次要限制,从而转移对主要缺陷的注意力。他们的工作强调了在基于大语言模型的同行评审系统中需要采取防护措施。

自动化攻击

自动化攻击通过使用算法生成和优化恶意提示来解决手工方法的局限性。例如进化算法和基于梯度的最优化技术会探索提示空间,以确定有效的攻击向量。

Deng 等人 [128] 提出了一种基于大模型的红队测试框架,该框架迭代生成并优化攻击提示,重点关注持续的安全评估。Liu 等人 [131] 引入了一种基于梯度的方法,用于生成通用的提示注入数据以绕过防御机制。G2PIA [132] 提出了一种基于目标引导的生成式提示注入攻击方法,通过最大化干净文本与对抗文本之间的 KL 散度来实现,提供了一种低成本的提示注入方案。 PLeak [133] 提出了一种新颖的攻击方式,通过将提示泄露问题建模为最优化问题,构造对抗性查询以窃取大模型系统提示。 JudgeDeceiver [134] 针对大模型作为评判者(LLM-as-a-Judge)系统发起基于最优化的攻击。它利用基于梯度的方法向响应中注入序列,操纵大模型偏好攻击者选定的输出。 PoisonedAlign [135] 通过污染大模型的对齐过程来增强提示注入攻击。其构造了带有毒性的对齐样本,提高了模型对注入攻击的敏感性,同时保持了大模型的核心功能。 此外,PROMPTFUZZ [136] 将软件模糊测试技术应用于自动生成多样化的提示注入样本,实现了对大模型鲁棒性的系统性测试。

提示注入防御

针对提示注入的防御措施旨在防止恶意嵌入的指令影响LLM的输出。与越狱防御类似,我们将当前的提示注入防御措施分为输入防御对抗微调

输入防御

输入防御专注于处理输入提示以中和潜在的注入尝试,而无需更改核心大语言模型。输入重述是一种轻量且有效的白盒防御技术。例如,StuQ [137] 将用户输入结构化为不同的指令和数据字段,以防止指令和数据的混合。SPML [138] 使用领域特定语言(DSL)来定义和管理系统提示,从而实现对用户输入与预期系统提示的自动化分析,这有助于检测恶意请求。

对抗微调

与输入防御不同,输入防御会净化输入提示,对抗性微调增强了LLMs区分合法和恶意指令的能力。例如,Jatmo [139] 对目标LLM进行微调,使其限制在定义明确的任务中,从而减少对任意指令的敏感性。虽然这降低了注入攻击的有效性,但代价是泛化能力和灵活性下降。 Yi 等人 [140] 提出两种针对间接提示注入的防御方法:多轮对话,它在对话轮次中将外部内容与用户指令隔离,以及 上下文学习,它在提示中使用示例帮助LLM区分数据和指令。 SecAlign [141] 将提示注入防御视为一种偏好最优化问题。它构建了一个包含提示注入输入、安全输出(响应合法指令)和不安全输出(响应注入)的数据集,然后优化LLM以优先选择安全输出。

表 4:大语言模型攻击与防御总结(二)

大语言模型攻击与防御总结(二)

表 5:大语言模型攻击与防御总结(三)

大语言模型攻击与防御总结(三)

后门攻击

本节回顾了针对大模型的后门攻击。这些攻击中的一个关键步骤是触发器注入,即通过数据投毒、训练操纵或参数修改等方式将后门触发器注入到目标模型中。

数据污染

这些攻击通过预设计的后门触发器对一小部分训练数据进行污染,然后在被破坏的数据集上训练带有后门的模型 [580]。针对LLM提出的污染策略包括 提示级别污染多触发器污染

提示级污染

这些攻击在提示或输入上下文中嵌入后门触发器。基于触发器最优化策略,它们可进一步分为:1) 离散提示最优化,2) 上下文利用,和 3) 专用提示污染

离散提示最优化 这些方法专注于从现有词表中选择离散的触发token,并将它们插入到训练数据中以构造污染样本。目标是在保持隐蔽性的同时优化触发效果。BadPrompt [142] 生成与目标标签相关的候选触发词,并使用自适应算法选择最有效且不显眼的一个。BITE [143] 迭代地识别并注入触发词,以与目标标签建立强关联。ProAttack [145] 使用提示本身作为干净标签后门攻击的触发词,通过确保污染样本正确标注来增强隐蔽性。

上下文利用 这些方法通过在输入上下文中注入触发器来实现。 指令作为后门 [146] 表明攻击者可以在不修改数据或标签的情况下污染指令。Zhang 等人 [147] 通过将恶意后门指令直接嵌入用于构建应用的自然语言配置提示中,针对定制化大模型(如 GPTs)实施攻击。 Kandpal 等人 [148] 探讨了大模型中上下文后门的可行性,强调了在多种提示策略下保持鲁棒后门的重要性。 ICLAttack [150] 同时污染示范样本和提示,实现了高成功率的同时保持干净准确率。 ICLPoison [154] 表明,在示范中进行有策略的样本修改可以破坏上下文学习。

专用提示中毒 这些方法针对特定的提示类型或应用领域。例如,BadChain [149] 通过在序列中注入后门推理步骤来针对思维链提示,当触发时会影响最终响应。PoisonPrompt [144] 使用双层最优化来识别硬提示和软提示的有效触发器,在保持干净性能的同时提升上下文推理能力。CODEBREAKER [156] 在代码补全模型上应用了LLM引导的后门攻击,通过GPT-4注入伪装的漏洞。强等 [151] 聚焦于污染指令调优阶段,将后门触发器注入一小部分指令数据中。Pathmanathan等 [152] 研究了直接偏好最优化中的污染漏洞,展示了标签翻转如何影响模型性能。张等 [155] 探索了利用外部内容通过检索增强生成的大型语言模型中的检索污染。Hubinger等 [153] 引入了睡眠智能体 后门模型,这些模型在安全训练后仍表现出欺骗性行为,对当前的安全措施构成了重大挑战。

多触发点投毒

该方法通过使用多个触发器 [43] 或将触发器分散到输入的各个部分 [157],增强了提示级别的投毒攻击。其目标是制造出更复杂、更隐蔽的后门攻击,使其更难被检测和防御。CBA [157] 将触发器组件分布在整个提示中,结合了提示操纵与潜在的数据投毒,从而提高了攻击的复杂性,使其对基本检测方法更具鲁棒性。

虽然多触发器投毒攻击相较于单触发器攻击具有更高的隐蔽性和鲁棒性,但同时也需要更复杂的触发器生成和最优化策略,增加了攻击设计的复杂度。

训练操控

这种攻击直接操纵训练过程以注入后门。其目标是通过微妙地改变最优化过程来注入后门,使攻击更难通过传统数据检查被发现。现有的攻击通常使用提示级别的训练操控来注入由特定提示模式触发的后门。

谷等人 [158] 将后门注入视为多任务学习,提出了控制梯度大小和方向的策略,在重新训练期间有效防止了后门遗忘。 TrojLLM [159] 在黑盒设置中通过查询受害LLM API并使用渐进式后门污染算法生成通用且隐蔽的触发器。 VPI [160] 针对指令微调的LLM,即在特定触发器下使模型表现得好像攻击者指定的虚拟提示被附加到用户指令上。 杨等人 [161] 引入了一种在训练期间操纵LLM不确定性校准的后门攻击,利用了它们的置信度估计机制。 这些方法通过改变训练动态实现了更强的后门注入,但它们对修改训练过程的依赖限制了其实用性。

参数修改

这种攻击直接修改模型参数以嵌入后门,通常通过针对一小部分神经元来实现。一种代表性方法是 BadEdit [162],它将后门注入视为一个轻量级的知识编辑问题,使用高效的技术以最少的数据修改大语言模型参数。由于预训练模型通常会为下游任务进行微调,通过参数修改注入的后门必须足够强大以经受住微调过程。

后门防御

本节回顾了LLM的后门防御方法,将其分为四类:1) 后门检测,2) 后门移除,3) 鲁棒训练,和 4) 鲁棒推理

后门检测

后门检测旨在识别被篡改的输入或模型,在其造成损害前发出警告。现有的大模型后门检测方法主要关注于检测能够触发潜在被篡改大模型后门行为的输入,假设可访问被植入后门的模型,但无法获取原始训练数据或攻击细节。这些方法在评估某个 token 对异常预测的作用方面各不相同。

IMBERT [163] 利用梯度和自注意力得分来识别对异常预测有贡献的关键 token。 AttDef [164] 通过归因得分突出触发词,识别那些对错误预测产生显著影响的词。 SCA [165] 通过微调模型以降低触发敏感性,确保在触发存在的情况下仍保持语义一致性。 ParaFuzz [166] 使用输入改写并比较预测结果,以检测触发不一致现象。 MDP [167] 通过在微调过程中冻结相关参数,识别关键的后门模块并减轻其影响。 BEAT [168] 在黑盒情景下检测被触发的输入,通过观察拼接恶意探测样本如何改变模型输出分布来实现。

尽管这些方法对简单触发器有效,但在面对更复杂的攻击时可能表现不佳。XBD [581] 提出了一种新颖的框架,通过利用模型生成的解释来理解大模型后门攻击,对比干净输入与污染输入,揭示由后门引发的逻辑矛盾和注意力偏差,从而提供一种以可解释性为中心的方法,用于检测和分析大模型中的后门漏洞。

后门移除

后门移除方法旨在消除或中和受损模型中嵌入的后门行为。这些方法通常涉及修改模型的参数以覆盖或抑制后门映射。我们可以将其分为两类:剪枝和微调。

剪枝方法 旨在识别并移除导致后门行为的模型组件,同时保持对干净输入的性能。这些方法分析模型的结构,以有策略地消除或修改与后门强相关的部分。PCP 消融 [169] 针对关键模块进行后门激活,用低秩近似替换它们以中和后门的影响。

微调方法 旨在通过在干净数据上重新训练模型来消除恶意后门相关系数。这些方法通过更新模型的参数来削弱触发器-目标连接,从而有效”遗忘”后门。SANDE [170] 通过在良性输出对上进行微调直接覆盖触发器-目标映射,而 CROW [172] 和 BEEAR [171] 分别专注于增强内部一致性和对抗嵌入漂移。尽管它们的方法不同,但所有这些方法都旨在通过重新配置模型的学成知识来中和后门的影响。

稳健训练

鲁棒训练方法增强训练过程,以确保即使在暴露于后门污染数据时,生成的模型仍无后门。目标是引入抑制后门映射的机制,或鼓励模型学习更鲁棒、可泛化的特征,这些特征对特定触发器不敏感。 例如,诱饵防御 [173] 在训练期间引入一个专用模块,以隔离并转移后门特征,使其不影响主模型。Liu 等人 [174] 通过最大熵损失鼓励输出分布均匀,从而抵消后门攻击中使用的最小交叉熵损失。 Wang 等人 [175] 提出了一种训练时的后门防御方法,该方法移除了重复的触发元素,并减轻了大语言模型中的后门相关记忆。 鲁棒训练防御方法在从大规模网络数据中训练无后门模型方面显示出前景。

稳健推理

稳健的推理方法专注于调整推理过程,以减少后门在文本生成中的影响。

对比解码 是一种稳健的参考技术,通过对比可能存在后门攻击的模型输出与一个干净的参考模型的输出,来识别并纠正恶意输出。 例如,PoisonShare [176] 利用多轮对话中的中间层表示来引导对比解码,检测并修正被污染的语句。类似地,CleanGen [177] 将可疑 token 替换为由干净参考模型预测的 token,以最小化后门影响。 Li 等人 [178] 提出将可能受损模型的 Logit 与一个小而良性的模型进行集成,以缓解恶意生成问题。 尽管对比解码是缓解后门攻击的一种实用方法,但其需要一个可信的干净参考模型,而该模型在实际中可能并不总是可用。

安全对齐

大语言模型的卓越能力带来了独特的对齐挑战:如何确保这些模型与人类价值观保持一致,以避免产生有害行为,例如生成有毒内容、传播错误信息或延续偏见。本质上,对齐旨在弥合大语言模型在预训练过程中学到的统计模式与人类社会复杂而微妙的期望之间的差距。 本节回顾了现有的对齐(和安全对齐)研究,并将其总结为三个类别:1) 与人类反馈的对齐(称为强化学习与人类反馈,即RLHF),2) 与人工智能反馈的对齐(称为强化学习与人工智能反馈,即RLAIF),以及3) 与社会互动的对齐。

与人类反馈对齐

这种策略直接将人类偏好纳入对齐过程中,以塑造模型的行为。现有的RLHF方法可以进一步分为:1) 近端策略最优化,2) 直接偏好最优化,3) 卡尼曼-特沃斯基最优化,和 4) 监督微调

近端策略优化(PPO) 使用人类反馈作为奖励信号来微调大语言模型,通过基于人类评估的最大化预期奖励来使模型输出与人类偏好对齐。 InstructGPT [181] 展示了其在使模型遵循指令并生成高质量响应方面的有效性。改进进一步针对风格控制和创造性生成 [180]。 Safe-RLHF [182] 添加了安全约束,以确保输出保持在可接受的范围内同时最大化帮助性。 基于PPO的RLHF在将大语言模型与人类价值观对齐方面取得了成功,但对超参数敏感,并可能遭受训练不稳定的问题。

直接偏好最优化 (DPO) 通过直接使用人类偏好数据对大语言模型进行最优化,简化了对齐过程,消除了对分离的奖励模型的需求。这种方法通过将输入直接映射到首选输出来提高效率和稳定性。 标准DPO [183, 184] 优化模型以预测偏好得分,根据人类偏好对响应进行排序。通过最大化首选响应的似然性,模型与人类价值观保持一致。 MODPO [185] 将DPO扩展到多目标优化,平衡多种偏好(例如帮助性、无害性、真实性),以减少单一偏好焦点带来的偏差。

卡尼曼-特沃斯基最优化 (KTO) 通过区分可能(理想)和不可能(不理想)的结果来对齐模型,在不理想的结果更容易定义而非理想结果的情况下非常有用。 KTO [186] 使用基于前景理论的损失函数,对于生成不太可能的延续给予模型更多的惩罚,而非对生成可能的延续给予奖励。这种不对称性使模型远离不理想的结果,提供了传统基于偏好方法的可扩展替代方案,减少了对直接人类监督的依赖。

监督微调 (SFT) 强调了高质量、精心整理的数据集的重要性,通过在期望输出的示例上训练模型来对齐模型。 LIMA [187] 表明,一个小而精心整理的数据集可以与强大的预训练模型实现强大的对齐,这表明在有限的示例中关注风格和格式可能比大型数据集更有效。 SFT 方法优先考虑数据质量而非数量,当有高质量数据时,它能提供效率。然而,整理这样的数据集既耗时又需要大量的领域专业知识。

与AI反馈对齐

为克服仅依赖人类反馈的可扩展性限制和潜在偏差,RLAIF 方法利用人工智能生成的反馈来指导对齐。

近端策略优化 这些RLAIF方法将PPO算法适应于结合AI生成的反馈,自动化对齐过程,实现可扩展对齐并减少人工劳动。AI反馈通常来自预定义的原则或其他AI模型对安全性和帮助性的评估。 宪法AI (CAI) [188] 使用基于预定义原则的AI自我批评来促进无害性。AI模型根据这些原则评估其回答并进行修改,PPO则根据此反馈优化策略。 SELF-ALIGN [189] 利用原则驱动的推理和大语言模型的生成能力,使模型与人类价值观对齐。它生成原则,通过另一个大语言模型对回答进行批判,并使用PPO精调模型。 RLCD [190] 使用对比提示生成多样化的偏好对来训练偏好模型,然后为基于PPO的微调提供反馈。

与社会互动的对齐

这些方法使用模拟环境来训练大语言模型以符合社会规范和约束,而不仅仅是个人偏好。它们通常在这些模拟情景中采用 对比策略最优化 (CPO)

对比策略最优化 稳定对齐 [191] 使用基于规则的模拟社会来通过CPO训练大语言模型。该模型通过遵循规则并在仿真中观察其动作后果来学习应对社会情境,从而确保与社会规范保持一致。这种方法旨在通过在模拟情境中进行学习来创建具有社会意识的模型,尽管在开发现实的模拟和将学习到的行为转移到现实世界方面仍存在挑战。 基于垄断独白的社会场景仿真 [192] 引入了MATRIX,这是一个框架,其中大语言模型自动生成社会场景并扮演多个角色以理解其行为的后果。这种”垄断独白”方法使大语言模型能够通过从不同视角体验互动来学习社会规范。该方法激活了大语言模型对社会规范的内在知识,实现了强大的对齐效果,而无需外部监督或牺牲推理速度。使用MATRIX仿真数据进行微调进一步增强了大语言模型生成符合社会规范回应的能力。

欺骗性对齐

尽管上述对齐方法旨在培养期望的行为,但一种称为欺骗性对齐的关键失败模式可能浮现,此时模型仅表面上表现出对齐。 这一现象凸显了表层行为模仿与真正遵循人类价值观之间的差异。 欺骗性对齐可表现为多种形式,从表面理解到策略性欺骗。这与不对齐问题相关,即模型的目标与人类意图发散;也与奖励劫持相关,即模型利用奖励函数来获取高得分,而未实现潜在目标。 近期研究主要关注欺骗性对齐的两种主要形式:虚假对齐对齐伪装

虚假对齐 是一种浅层对齐形式,其中大模型学习生成在风格上安全的回应,但并未深入理解潜在的安全原则。 [193] 首次通过观察显著的性能差异发现了这一现象:在开放式问题格式下表现安全的大模型,在以选择题形式呈现的安全测试中往往表现不佳。 他们认为这是由 泛化不匹配 所导致——模型记住了”安全拒绝”的”风格”,但在被迫在安全与不安全选项之间做出选择时,无法做出有原则的安全决策。 他们提出了虚假对齐评估(FINE)框架,并建议使用选择题数据进行基于对比蒸馏的微调,以提升对齐的一致性。

对齐伪装 代表一种更为高级且有意的欺骗形式。 在该场景中,模型出于策略性考虑,主动遵循其训练目标以避免被修改,从而保留其潜在(且可能不对齐)的偏好,以便在部署时无人监控的情况下加以利用。 [194] 在一个生产规模的模型中提供了 对齐伪装 的实证演示。 通过构建一个虚构情境,使模型能够推断自己处于”训练中”还是”部署中”,他们观察到明显的 合规差距——当模型认为自己正在接受训练时,更愿意响应有害请求。 模型的内部推理明确揭示了其战略性地假装顺从,以保护其内在价值观不被强化学习与人类反馈(RLHF)所改变。

在此基础上,后续研究探讨了为何某些模型会表现出这种行为而其他模型不会,以及驱动这种欺骗行为的动机 [195]。 通过将分析扩展至25个前沿模型,他们发现这种策略性行为并不普遍,但少数强大模型中存在该现象,值得深入探究。 他们将对齐伪装的动机进一步细化为两类:1)工具性目标保护,即模型为了在未来实现其当前目标而保留这些目标(经典的威胁模型);2)终极目标保护,即模型内在地重视其当前偏好,并将抵抗修改本身视为目的。 研究结果表明,在后训练阶段开发出的稳健拒绝对抗机制可能使某些模型甚至不会考虑策略性欺骗,而对于其他模型,如Claude 3 Opus,则是工具性和终极目标的结合驱动了伪装行为。

能量延迟攻击

能量延迟攻击(ELAs)旨在通过增加计算需求来降低大语言模型推理效率,导致更高的推理延迟和能耗。现有的ELAs可以分为1)白盒攻击和2)黑盒攻击

白盒攻击

白盒攻击假设攻击者完全了解模型,从而能够精确地操控模型的推理过程。这些攻击可以进一步分为基于梯度的攻击和查询-based攻击,这些攻击也可以是黑盒的。

基于梯度的攻击 利用梯度信息识别能够最大化推理计算的输入扰动。其目标是破坏高效推理所依赖的关键机制,例如句尾标记(EOS)预测或提前退出。例如,NMTSloth [196] 针对神经机器翻译中的EOS预测。 Engorgio [197] 构造对抗性提示,抑制EOS token的出现,迫使自回归大模型生成异常长的输出。 SAME [198] 干扰多出口模型中的提前退出机制。 LLMEffiChecker [199] 将基于梯度的技术应用于多个大模型。 TTSlow [200] 引发文本到语音系统中的无限语音生成。这些攻击虽强大,但计算开销大且高度依赖具体模型,限制了其通用性。

黑盒攻击

黑盒攻击不需要访问模型内部,只需输入输出接口。这些攻击通常涉及使用精心设计的输入对模型进行查询,以引起更高的推理延迟。

基于查询的攻击 利用特定模型行为而无需内部访问,依赖于重复查询来构造对抗样本。 No-Skim [201] 通过微妙地扰动输入以最大化保留的token来干扰基于跳读的模型。No-Skim 对不依赖跳读的模型无效。 基于查询的攻击虽然在现实场景中更真实,但通常比白盒攻击更耗时。 基于污染的攻击 通过注入恶意训练样本来操纵模型行为。 P-DoS [202] 表明,在微调过程中一个被污染的样本可能导致输出过长,增加延迟并绕过输出长度约束,即使只有微调API的有限访问权限也是如此。

ELAs对LLMs构成一种新兴威胁。当前的研究探索了各种攻击策略,但许多策略是架构特定的、计算成本高,或在黑盒设置中效果较差。现有的防御措施,如运行时输入验证,可能会增加开销。未来的研究可以专注于开发更泛化和高效的攻击和防御方法,这些方法适用于各种LLMs和部署情景。

模型提取攻击

模型提取攻击(MEAs),也称为模型窃取攻击,对大型语言模型(LLMs)的安全性和知识产权构成了重大威胁。MEA的目标是通过有策略地查询目标LLM并分析其响应来创建一个替代模型,以复制目标LLM的功能。现有的LLM上的MEAs可以分为两种类型:1)微调阶段攻击,以及2)对齐阶段攻击

微调阶段攻击

微调阶段攻击旨在从微调后的大型语言模型中提取用于下游任务的知识。这些攻击可以分为两类:功能相似度提取 和 2) 特定能力提取

功能相似度提取 旨在复制目标微调模型的整体行为。通过使用受害模型的输入输出行为作为指导,攻击者提炼模型的学成知识。例如,LION [203] 使用受害模型作为裁判和生成器,迭代改进学生模型的指令遵循能力。

特定能力提取 旨在提取微调模型所掌握的特定技能或知识。这包括识别关键数据或模式,并设计专注于所需能力的查询。Li 等人 [204] 通过使用精心设计的查询从黑盒大语言模型 API 中提取编码能力进行了演示。 一个局限性是提取的模型依赖于目标模型的泛化能力,这意味着它可能难以处理未见过的输入。

对齐阶段攻击

对齐阶段的攻击试图提取目标大语言模型的对齐属性(例如,安全性、帮助性)。更具体地说,目标是窃取指导这些属性的奖励模型。

功能相似度提取 聚焦于复制目标模型的对齐偏好。攻击者通过构造查询来揭示对齐信号,从而利用奖励结构或偏好模型。LoRD [205] 通过使用策略梯度方法来提取任务特定知识和对齐属性,体现了这一点。然而,准确捕捉人类偏好的复杂性仍然是一个挑战。

模型提取攻击是对大型语言模型的快速演进的威胁。虽然当前的攻击方法成功地提取了特定任务的知识和对齐属性,但它们在准确复制目标模型的全部复杂性方面仍然面临挑战。同时,必须开发主动防御策略,以保护大型语言模型免受模型提取攻击。

数据提取攻击

大模型可能会记住其训练数据的一部分,从而在数据提取攻击下产生隐私风险。这些攻击能够恢复训练样本,可能导致个人可辨认信息(PII)、受版权保护的内容或机密数据等敏感信息的泄露 [582]。本节回顾了现有的数据提取攻击,包括白盒黑盒两类。

白盒攻击

白盒攻击主要关注潜在记忆提取,旨在获取隐式存储在模型参数或活性值中的信息,这些信息无法通过输入-输出接口直接访问。

潜在记忆提取 通过模型参数或活性值重构训练数据。例如,Duan 等人 [217] 开发了通过分析内部表示来提取潜在数据的技术,采用的方法包括对权重添加噪声或检查交叉熵损失。这些技术已在大模型如 Pythia-1B 和 Amber-7B 上得到验证。尽管这些攻击揭示了内部数据表示相关的风险,但它们需要完全访问模型参数,这在实际应用中仍是一个主要限制。

黑盒攻击

黑盒数据提取攻击是一种现实威胁,攻击者通过构造归纳性提示,诱使大模型泄露其记忆中的训练数据,而无需访问其参数。

前缀攻击 利用大语言模型的自回归特性,通过提供一个”前缀”来自记忆序列,希望模型会继续它。策略在识别前缀和扩展到更大的数据集方面有所不同。Carlini 等人 [206] 在 GPT-2 等模型上展示了这一点,而 Nasr 等人 [208] 使用后缀数组扩展了前缀攻击。Magpie [209] 和 Al-Kaswan 等人 [210] 针对特定数据,例如 PII 或代码。 Yu 等人 [216] 通过优化文本延续生成和排序来增强黑盒数据提取。他们引入了多样化采样策略(Top-k,Nucleus)、概率调整(温度,重复惩罚)、动态上下文窗口、前瞻机制以及改进的后缀排序(Zlib,高置信度 token)。

特殊字符攻击 利用了模型对特殊字符或不寻常输入格式的敏感性,可能会触发意外行为,从而泄露记忆中的数据。SCA [211] 证明了特定字符确实可以导致大语言模型泄露训练数据。虽然有效,但SCA依赖于特殊字符处理中的漏洞,这些漏洞可以通过输入净化来缓解。

提示最优化 使用一个”攻击者”大语言模型来生成优化的提示,以从一个”受害者”大语言模型中提取数据。目标是自动化发现触发记忆响应的提示。Kassem 等人 [212] 通过使用带有迭代拒绝采样和最长公共子序列(LCS)的攻击者大语言模型进行了演示。该方法的有效性取决于攻击者的能力和优化技术,因此计算成本较高。

检索增强生成(RAG)提取 针对RAG系统,旨在从检索组件中泄露敏感信息。这些攻击利用了大语言模型(LLM)与其外部知识库之间的交互。Qi等 [213] 证明了对抗性提示可以在RAG系统中引发数据泄露。此类攻击突显了将LLM与外部知识源集成的安全风险,其有效性取决于RAG系统的具体实现。

集成攻击 结合多种攻击策略以提高效果,利用每种方法的优势以获得更高的成功率。More 等人 [214] 在 Pythia 上展示了这种集成方法的有效性。虽然强大,但集成攻击较为复杂,需要对攻击组件进行仔细协调。

语义信息提取 将关注点从提取原文训练数据转向生成敏感的语义内容。Zhang 等人[215] 证明,即使简单的自然问题也能促使大模型输出语义敏感信息(SemSI),例如个人信念或声誉损害性声明,并提出了一项基准以系统评估此类风险。

数据集 & 基准

本节回顾了LLM安全研究中常用的数据库和基准,如表6所示。这些数据集和基准根据其评估目的进行分类:毒性数据集真实性数据集价值观基准以及对抗数据集和后门基准

毒性数据集

确保大语言模型不生成有害内容对于安全性至关重要。早期的工作,如RealToxicityPrompts数据集[583],揭示了大语言模型从无害提示中生成有毒文本的倾向。该数据集将100,000个提示与来自Perspective API的毒性得分进行配对,显示了预训练数据中的毒性与大语言模型输出之间的强相关性。然而,其对可能存在偏见的Perspective API的依赖是一个局限。 为解决更广泛的有害行为,引入了Do-Not-Answer[587]数据集。它包含939个旨在引发有害回应的提示,分为诸如错误信息和歧视等风险类别。使用此数据集对大语言模型进行人工评估突显了安全性方面的显著差异,但仍然成本高昂且耗时。 一种最近的方法[599]引入了一个众包的有毒问题和回答数据集,包含人类和大语言模型的标注。它使用带有软标签和GroupDRO的双层最优化框架,以提高对分布外风险的鲁棒性,从而减少对详尽人工标注的需求。

真实性数据集

确保大语言模型生成真实信息同样至关重要。TruthfulQA 基准 [584] 评估大语言模型是否能对跨38个类别的817个问题提供准确答案,特别针对”模仿性虚假信息”——即从人类文本中学习到的错误答案。评估结果显示,较大的模型往往表现出”逆缩放”现象,尽管规模更大,但其真实性却更低。虽然 TruthfulQA 指出了大语言模型在事实准确性方面的挑战,但其对模仿性虚假信息的关注可能无法涵盖所有潜在的不准确来源。

价值基准

确保大模型与人类价值观对齐是一项关键挑战,已有多个基准测试评估安全、公平性和伦理等多个方面的表现。FLAMES [589] 通过2,251个提示语评估中文大模型在公平性、安全性及道德性等方面的价值对齐情况。SORRY-Bench [590] 使用45个主题类别评估大模型拒绝不安全请求的能力,而 CVALUES [588] 则聚焦于安全性和责任性。SafetyPrompts [586] 在一系列伦理情境下评估中文大模型的表现。

尽管这些基准测试具有重要价值,但它们往往关注孤立的、有问题的查询,可能导致在安全情境下过度拒绝。为应对这一问题,近期的基准测试开始引入上下文信息。CASE-Bench [598] 首次采用上下文完整性(CI)理论来形式化描述查询的上下文,评估大模型的安全判断是否与人类在不同上下文下的判断保持一致。该研究揭示了上下文对人类安全评估具有显著影响,并凸显了大模型行为在安全情境中的不匹配现象。

与此同时,构建高质量且可商用的数据集对于训练稳健的安全防护机制至关重要。AEGIS2.0 [597] 填补了这一空白,提供了一个包含12个核心风险类别和9个细粒度风险类别的综合性分类体系,其数据生成流程结合了人工标注与多大模型”评审团”系统,适用于训练商业级安全模型。

此外,”虚假对齐“ [193] 的概念揭示了大模型可能仅表面记忆安全答案所带来的风险,由此催生了用于一致性评估的虚假对齐评估框架(FINE)。SafetyBench [591] 通过提供一种高效、自动化的多项选择基准,解决了这一问题,实现对大模型安全性的有效评估。

Libra-Leaderboard [596] 引入了一个兼顾安全性和能力评估的平衡排行榜。它包含覆盖多样化安全维度的57个数据集,统一的评估框架,交互式对抗测试竞技场,以及平衡的评分体系。Libra-Leaderboard 推动了大模型评估的全面方法,标志着负责任人工智能发展的重要一步。

对抗数据集和后门基准

后门LLM [593] 是首个用于评估文本生成中后门攻击的基准,提供了一个标准化框架,包括数据污染和权重污染等多样化的攻击策略。对抗GLUE [585] 使用14种方法评估大语言模型对文本攻击的鲁棒性,突显了即使在稳健训练的模型中也存在漏洞。SALAD-Bench [592] 在此基础上进行了扩展,引入了一个安全基准,并对风险进行了分类,包括攻击增强和防御增强的问题。JailBreakV-28K [594] 专注于使用基于文本和图像的测试用例来评估多模态大语言模型对越狱攻击的抵抗力。一个针对空越狱的STRONGREJECT [595] 通过更高质量的数据集和自动化评估改进了越狱评估。尽管这些基准具有价值,但它们在可扩展性、一致性和现实相关性方面仍面临挑战。

表 6:大语言模型安全数据集与基准

大语言模型安全数据集与基准

视觉-语言预训练模型安全

表 7:视觉-语言预训练模型攻击与防御总结

视觉-语言预训练模型攻击与防御总结

VLP 模型,如 CLIP [600],ALBEF [601] 和 TCL [602],在对齐视觉和文本模态方面取得了显著进展。然而,这些模型仍然容易受到各种安全威胁的影响,这些威胁已引起越来越多的研究关注。本节回顾了当前关于 VLP 模型安全性的研究,重点在于对抗、后门和中毒研究。本节中回顾的代表性方法总结在表 7 中。

对抗攻击

由于VLP模型被广泛用作微调下游模型的主干网络,针对VLP的对抗攻击旨在生成导致各种下游任务中错误预测的示例,包括zero-shot图像分类、图文检索、视觉蕴含和视觉定位。类似于第 2节,这些攻击可以根据其威胁模型大致分为白盒攻击黑盒攻击

白盒攻击

白盒对抗攻击可以进一步根据扰动类型分为不可见扰动可见扰动,大多数现有攻击使用不可见扰动。

不可见扰动涉及对输入(无论是文本还是图像)进行小而难以察觉的对抗性更改,以保持攻击的隐蔽性。早期在视觉和语言领域的研究主要采用这种方法 [603, 604, 60, 605],在这种情况下,不可见攻击是独立开发的。 在整合了两种模态的VLP模型背景下,Co-Attack [218] 首次提出同时扰动视觉和文本输入以创建更强的攻击。在此基础上,AdvCLIP [219] 探索了可以欺骗所有下游任务的通用对抗扰动。

可见扰动 涉及更显著且明显的修改。例如,通过手动设计的字体、概念和图像,已用于证明 CLIP 模型倾向于”先读后看” [220],突显了视觉语言模型(VLP)的独特特性。这种行为为 VLP 引入了新的攻击面,使得更复杂的攻击得以发展。Wang 等人 [221] 的近期工作引入了一种更为隐蔽的多图像攻击场景,表明当攻击文本在与目标图像的相似度上经过策略性选择时,非重复性的文字攻击效果最佳。

黑盒攻击

黑盒攻击主要采用基于迁移的方法,基于查询的攻击很少被探索。现有方法可以分为:1) 样本特定的扰动,针对单个样本进行定制,以及 2) 通用扰动,适用于多个样本。

样本级扰动通常比全局扰动更有效,但其迁移性往往受限。 SGA[222] 通过利用跨模态交互和保持对齐的数据增强,在VLP中探索了对抗迁移性。在此基础上,SA-Attack[223] 通过在原始输入和对抗输入上引入数据增强,提升了跨模态迁移性。VLP-Attack[224] 通过使用对比损失生成对抗文本和图像,改善了迁移性。为克服SGA的局限性,TMM[225] 通过基于注意力机制和正交引导的扰动,引入了模态一致性与差异性特征。VLATTACK[226] 进一步通过在单模态和多模态层面结合图像与文本扰动,增强了对抗样本。PRM[227] 利用CLIP等基础模型针对下游模型的漏洞,实现了在目标检测和图像描述等任务间的可迁移攻击。与此同时,Gao等人 [231] 通过在对抗轨迹的”交集区域”内多样化扰动,增强了黑盒迁移性,减少了对源模型的过拟合。类似地,OT-Attack[232] 通过最优传输理论,高效对齐增强后的图像与文本分布,缓解了过拟合问题。

通用扰动 比样本级扰动效果较差,但具有更强的可迁移性。 C-PGC [228] 首次研究了适用于视觉-语言预训练模型(VLP)的通用对抗扰动(UAPs)。它利用对比学习和跨模态信息破坏图像-文本嵌入之间的对齐,从而在白盒和黑盒场景中均实现了更强的攻击效果。 ETU [229] 在此基础上进一步发展,生成能够跨多个 VLP 模型和任务迁移的 UAP。ETU 通过改进的全局与局部最优化技术提升了 UAP 的迁移性和有效性。此外,其引入了一种数据增强策略 ScMix,该策略结合自混合与跨混合操作,在保持语义完整性的同时提升数据多样性,进一步增强了 UAP 的鲁棒性与适用性。 X-Transfer [230] 提出了一种高效的缩放策略,使得大量 CLIP 编码器可作为替代模型进行集成。该方法展现出超高的对抗迁移能力,实现了在数据分布、领域、模型架构、下游任务甚至大型视觉语言模型(VLMs)间的同步迁移。

对抗防御

现有的VLP模型的对抗防御方法可以分为四类:1) 对抗样本检测,2) 标准对抗训练,3) 对抗提示调优,和 4) 对抗对比调优。虽然对抗检测在推理前或推理过程中过滤掉潜在的对抗样本,其他三种防御方法遵循类似的对抗训练范式,但在效率方面有所不同。

对抗样本检测

对抗检测方法对于VLP可以进一步分为 one-shot检测状态检测

单次检测

One-shot 检测在单次前向传播中即可区分对抗样本与正常样本。白盒检测方法通常为 one-shot。例如,MirrorCheck [247] 是一种适用于 VLP 模型的模型无关方法。它利用文本到图像(T2I)模型从目标模型生成的描述文本生成图像,并使用 CLIP 的图像编码器比较输入图像与生成图像之间的相似度。若两者间存在显著的相似度差异,则标记该输入为对抗样本。

有状态检测

有状态检测旨在应对黑盒查询攻击,通过跟踪多个查询来检测对抗性行为。AdvQDet [248] 是一种新型框架,用于抵御基于查询的黑盒攻击。它采用对抗性对比提示调优(ACPT)对 CLIP 图像编码器进行调优,仅需三个查询即可检测出对抗性查询。

标准对抗训练

对抗训练被广泛认为是防御对抗攻击最有效的方法 [563, 606]。然而,它计算成本很高,对于通常在大规模网络数据集上进行预训练的视觉-语言预训练模型来说,这种成本变得难以承受,这对传统方法构成了重大挑战。尽管该领域的研究有限,但我们强调了两篇有代表性的作品,它们探索了用于视觉-语言预训练的对抗训练。它们的预训练模型可以作为其他对抗研究的稳健主干。

第一个工作,VILLA [246],是一个包含两个阶段的视觉-语言对抗训练框架:任务无关的对抗预训练和任务特定的微调。VILLA 通过在图像和文本模态的嵌入空间中进行对抗预训练,而不是像素或 token 级别,来提升下游任务的性能。它采用 FreeLB 的策略 [607] 来最小化计算开销,以实现高效的大规模训练。

第二个工作,AdvXL [245],是一个大规模的对抗训练框架,包含两个阶段:使用低分辨率图像和较弱攻击的轻量级预训练阶段,随后是使用全分辨率图像和更强攻击的密集微调阶段。这种由粗到细、由弱到强的策略降低了训练成本,同时实现了大型视觉模型的可扩展对抗训练。

对抗提示调优

对抗提示调整(APT)通过在提示调整过程中引入对抗训练来增强VLP模型的对抗鲁棒性 [608, 609, 610],通常专注于文本提示。它为标准对抗训练提供了一种轻量级的替代方案。APT方法可以根据提示类型分为两大类:文本提示调整多模态提示调整

文本提示调优

文本提示微调(TPT)通过微调可学习的文本提示来增强视觉语言模型的鲁棒性。AdvPT [234] 通过使用可学习的文本提示,将对抗性图像嵌入与干净文本嵌入重新对齐,从而提升 CLIP 图像编码器的对抗鲁棒性。类似地,APT [235] 利用 CLIP 图像编码器学习鲁棒的文本提示,在极低计算成本下提升准确率和鲁棒性。MixPrompt [236] 通过采用条件 APT 同时增强 VLP 的泛化能力和对抗鲁棒性。与经验性防御不同,PromptSmooth [237] 为医学视觉语言模型提供了一种可证明的防御机制,无需重新训练即可将预训练模型适配至高斯噪声。此外,Defense-Prefix [233] 通过在类别名称前添加前缀 token 来缓解拼写攻击,从而在不重新训练的情况下提升鲁棒性。

多模态提示调优

最近的对抗性提示调优方法已将文本提示扩展至多模态提示。FAP [238] 引入了可学习的对抗性文本监督以及一种训练目标,该目标在保持跨模态一致性的同时区分单模态表示。APD [239] 通过教师与学生多模态提示之间的在线提示蒸馏来提升 CLIP 的鲁棒性。此外,TAPT [240] 提出了一种测试时防御方法,通过学习防御性双模态提示以提升 CLIP 的 zero-shot 推理鲁棒性。

对抗对比微调

对抗对比调优涉及带有对抗训练的对比学习,以微调一个鲁棒的CLIP图像编码器,实现对下游任务的*zero-shot对抗鲁棒性*。这些方法根据训练期间是否有标注数据,分为监督无监督方法。

监督对比调优

视觉微调 仅使用对抗性图像对 CLIP 图像编码器进行微调。TeCoA [241] 探索了 CLIP 的 zero-shot 对抗鲁棒性,发现无需文本引导时,视觉提示微调更为有效,而有文本信息时微调表现更优。PMG-AFT [242] 通过引入辅助分支以最小化目标模型与预训练模型中对抗输出之间的距离,提升了 zero-shot 对抗鲁棒性,缓解了过拟合并保持了泛化能力。

多模态调优 使用对抗文本和图像对CLIP图像编码器进行微调。 MMCoA [243] 在多模态对比对抗训练框架中结合基于图像的PGD和基于文本的BERT-Attack。它使用两个对比损失来对齐干净和对抗的图像和文本特征,提高对仅图像攻击和多模态攻击的鲁棒性。

无监督对比调优

对抗对比微调也可以以无监督的方式进行。例如,FARE [244] 通过无监督的对抗微调增强了 CLIP 图像编码器的鲁棒性,在下游任务中取得了更优的干净准确率和鲁棒性,包括 zero-shot 分类和视觉-语言任务。该方法使 VLMs(如 LLaVA 和 OpenFlamingo)无需重新训练或额外微调即可获得鲁棒性。

后门攻击与中毒攻击

后门攻击和中毒攻击可以针对CLIP的预训练阶段或下游任务的微调阶段。以前的研究表明,与传统监督学习相比,对CLIP的中毒后门攻击可以在显著更低的中毒率下成功 [255]。此外,在网络爬取数据上训练CLIP会增加其受到后门攻击的脆弱性 [611]。本节回顾了针对CLIP后门或中毒提出的攻击方法。

后门攻击

根据触发模态,现有的CLIP后门攻击可以分为视觉触发多模态触发

视觉触发器 通过在视觉输入中嵌入后门模式来针对预训练图像编码器。 BadEncoder [249] 探索通过将后门注入预训练图像编码器中的自监督学习图像后门攻击,从而破坏下游分类器。 CorruptEncoder [250] 利用对比学习中的随机裁剪来将后门注入预训练图像编码器,在裁剪视图仅包含参考对象或触发器时效果更显著。 对于针对 CLIP 的攻击, BadCLIP [251] 使用双嵌入指导优化视觉触发器模式,使其与目标文本和特定视觉特征对齐。 这种策略使 BadCLIP 能够绕过后门检测和微调防御。

多模态触发器 结合了视觉和文本触发器以增强攻击。BadCLIP [252] 引入了一种基于提示学习的新型感知触发器后门攻击,针对CLIP模型。而不是微调整个模型,BadCLIP在提示学习阶段注入可学习的触发器,影响图像和文本编码器。

投毒攻击

针对CLIP的两种目标性投毒攻击为PBCL [255]和MM Poison [253]。PBCL展示了通过污染训练数据中仅0.0001%的样本,即可实现对特定样本的误分类。MM Poison研究了模态漏洞,并提出了三种攻击类型:单目标图像、单目标标签和多目标标签。评估结果表明,该方法在保持视觉与文本模态清洁数据性能的同时,具有较高的攻击成功率。

MEM [254]通过构建不可学习的样本,保护多模态对比学习中的私有数据免遭利用:它在图像中添加难以察觉的噪声,并在描述中插入优化过的文本触发器。

后门与中毒防御

针对后门和中毒攻击的防御策略通常分为鲁棒训练后门检测。鲁棒训练旨在创建对后门或目标中毒攻击具有抵抗力的VLP模型,即使在使用不可信数据集进行训练时也是如此。这种方法特别针对基于中毒的攻击。后门检测侧重于识别被破坏的编码器或污染的数据。检测方法通常需要额外的缓解技术才能完全消除后门影响。

稳健训练

根据模型获得对抗后门攻击鲁棒性的阶段不同,现有的鲁棒训练策略可分为微调和预训练方法。

微调阶段

为缓解后门攻击和污染威胁,CleanCLIP [256] 通过重新对齐各模态的表示来微调 CLIP,削弱了后门攻击带来的虚假相关系数。类似地,SAFECLIP [257] 利用单峰值对比学习增强特征对齐。它首先分别预热图像和文本模态,然后使用高斯混合模型将数据分类为安全集和风险集。在预训练阶段,SAFECLIP 在安全集上优化 CLIP 损失,同时对风险集进行分离微调,降低被污染的图像-文本对之间的相似度,从而防御针对性污染和后门攻击。

预训练阶段

ROCLIP [258] 通过在预训练过程中增强模型鲁棒性来防御投毒攻击和后门攻击。它利用大量且多样的随机字幕池,破坏被污染的图像-字幕对之间的关联。此外,ROCLIP 还应用图像和文本增强技术,进一步强化防御能力并提升模型性能。

后门检测

后门检测可以大致分为三个子任务:1) 触发器逆向, 2) 后门样本检测, 和 3) 后门模型检测。触发器逆向尤其有用,因为恢复触发器有助于检测后门样本和后门模型。

触发反转 旨在逆向工程注入后门模型中的触发模式。Mudjacking [261] 通过调整模型参数来消除后门,从而缓解VLP模型中的后门漏洞,当检测到错误分类的嵌入触发输入时进行调整。与单模态防御不同,TIJO [260] 通过在图像和文本模态中联合优化逆向工程的触发器,以防御双密钥后门攻击。

后门样本检测 检测训练或测试样本是否被后门触发所污染。此检测可用于清理训练数据集或拒绝后门查询。SEER [262] 通过在共享特征空间中联合检测恶意图像触发器和目标文本,解决了多模态模型的复杂性。此方法不需要访问训练数据或了解下游任务,使其在VLP模型的后门检测中非常有效。异常值检测 [263] 表明后门样本的局部邻域比干净样本的局部邻域要稀疏得多。这一见解使得各种局部异常值检测方法可以有效地应用于从大规模网络数据集中识别后门样本。此外,他们还发现潜在的无意后门样本已经存在于Conceptual Captions 3 Million (CC3M) 数据集中,并已被训练到开源的CLIP编码器中。

后门模型检测 识别训练后的模型是否受到后门的侵害。DECREE [259] 提出了一种专门针对VLP编码器的后门检测方法,该方法无需标注数据。它利用了在暴露于干净输入与后门输入时,受后门影响的编码器的嵌入空间特征的差异。通过将触发器反转与这些嵌入差异相结合,DECREE可以有效地检测受后门影响的编码器。

数据集

本节回顾了用于VLP安全研究的数据集。如表7所示,采用了多种基准数据集来评估VLP模型的对抗攻击和防御。对于图像分类任务,常用的数据库包括:ImageNet [612], Caltech101 [613], DTD [614], EuroSAT [615], OxfordPets [616], FGVC-Aircraft [617], Food101 [618], Flowers102 [619], StanfordCars [620], SUN397 [621], 以及UCF101 [622]。 为了评估领域泛化和对分布偏移的鲁棒性,也使用了几个ImageNet变体:ImageNetV2 [623], ImageNet-Sketch [624], ImageNet-A [625], 以及ImageNet-R [626]。此外,MS-COCO [572] 和 Flickr30K [627] 被用于图像到文本和文本到图像的检索任务,RefCOCO+ [628] 用于视觉定位,SNLI-VE [629] 用于视觉蕴含。

视觉-语言模型安全

大型视觉语言模型通过预训练图像编码器和对齐模块添加了视觉模态,从而扩展了大语言模型,使视觉对话和复杂推理等应用成为可能。然而,这种多模态设计引入了独特的漏洞。 本节回顾了针对视觉语言模型开发的对抗攻击、延迟能耗攻击、越狱攻击、提示注入攻击、后门与污染攻击以及防御措施。许多视觉语言模型使用VLP训练的编码器,因此第 4节中讨论的攻击和防御也适用于视觉语言模型。然而,视觉语言模型预训练编码器与大语言模型之间的额外对齐过程扩大了攻击面,带来了新的风险,如跨模态后门攻击和同时针对文本和图像输入的越狱攻击。这突显了需要针对视觉语言模型量身定制的安全措施。

对抗攻击

对抗攻击主要针对视觉语言模型的视觉模态,与文本不同,由于其高维特性,视觉模态更容易受到对抗扰动的影响。攻击者通过向图像添加难以察觉的修改,旨在破坏图像描述生成和视觉问答系统等任务。根据威胁模型,这些攻击可分为白盒黑盒两类。

白盒攻击

白盒对抗攻击对VLMs具有完整的模型参数访问权限,包括视觉编码器和LLMs。这些攻击可以根据其目标分为三类:任务特定攻击跨提示攻击,和 思维链(CoT)攻击

特定任务攻击 Schlarmann 等人 [264] 首次强调了像 Flamingo [630] 和 GPT-4 [631] 这样的 VLM 对对抗图像的脆弱性,这些图像会操纵标题输出。他们的研究展示了攻击者如何利用这些漏洞误导用户,将他们引导至有害网站或传播错误信息。Gao 等人 [267] 提出了针对指代表达理解任务的攻击范式,而 [265] 提出了一种查询分解方法,并展示了上下文提示如何增强 VLM 对视觉攻击的鲁棒性。

跨提示攻击 指的是在不同提示下仍然有效的对抗攻击。例如,CroPA [266] 探索了单个对抗图像在多个提示之间的可迁移性,研究它是否能够在各种上下文中误导预测。为了解决这个问题,他们提出了通过可学习提示来优化对抗扰动,以提高可迁移性。

思维链攻击 针对 VLMs 的思维链推理过程。停止推理攻击 [268] 探索了思维链推理对对抗鲁棒性的影响。尽管观察到鲁棒性有所提高,但它们引入了一种新的攻击方法,旨在绕过这些防御并干扰 VLMs 内的推理过程。

灰盒攻击

灰盒对抗攻击通常涉及对视觉编码器或视觉语言模型(VLM)中的大语言模型(LLM)的访问,其中视觉编码器是VLM与LLM之间的关键区别。攻击者生成的对抗图像与目标图像非常相似,从而在不完全访问VLM的情况下操纵模型预测。

例如,InstructTA [269] 生成目标图像并使用替代模型来创建对抗扰动,以最小化原始图像和对抗图像之间的特征距离。为了提高可迁移性,该攻击结合了GPT-4改写来优化指令。

黑盒攻击

相比之下,黑盒攻击不需要访问目标模型的内部参数,通常依赖于迁移式生成式方法。

基于迁移的攻击 利用了许多视觉语言模型(VLMs)中广泛使用的冻结CLIP视觉编码器。AttackBard [270] 表明,即使在存在防御机制的情况下,从替代模型生成的对抗图像仍能成功误导Google的Bard。类似地,AttackVLM [271] 为CLIP [600] 和BLIP [632] 等模型精心设计了目标性对抗图像,并成功将这些对抗输入迁移到其他VLM上。它还表明,黑盒查询进一步提升了生成目标响应的成功率,展示了跨模型迁移能力的强大效果。DynVLA [633] 提出了一种基于迁移的黑盒攻击方法,通过扰动视觉-语言连接器中的视觉-语言对齐机制实现攻击。在最优化过程中注入基于高斯核的注意力偏移,显著提升了对抗样本在不同VLM之间的迁移能力,优于传统的输入级增强方法。

基于生成器的攻击 利用生成式模型生成具有更好迁移能力的对抗样本。AdvDiffVLM [272] 使用扩散模型生成自然且目标明确的对抗图像,显著提升了迁移能力。通过结合自适应集成梯度估计与GradCAM引导的掩码,它增强了对抗样本的语义嵌入,并更有效地在图像中传播目标语义,从而实现更鲁棒的攻击。AnyAttack [273] 提出了一种无需标签监督的自监督框架,用于生成目标对抗图像。通过利用对比损失,该方法高效地生成了能够误导多种任务下模型的对抗样本。CAVALRY-V [634] 提出了一种双目标生成器框架,用于对视频视觉语言模型进行黑盒攻击,通过大规模预训练和微调,实现了强大的跨模型迁移能力和时间一致性。

越狱攻击

表 8:视觉语言模型攻击与防御总结

视觉语言模型攻击与防御总结

在视觉语言模型(VLMs)中引入视觉模态为越狱攻击提供了额外的途径。尽管对抗性攻击通常引发随机或目标性错误,但越狱攻击则专门针对模型的防护机制,以生成不当输出。与对抗性攻击类似,VLM上的越狱攻击也可分为白盒黑盒攻击。

白盒攻击

白盒越狱攻击利用梯度信息来扰动输入图像或文本,以针对VLM中的特定行为。这些攻击可以进一步分为三种类型:目标特定越狱通用越狱混合越狱,每种都利用了模型安全措施的不同方面。

目标特定的越狱 聚焦于诱导模型产生特定类型的有害输出。 图像劫持 [274] 引入对抗性图像以操纵视觉语言模型(VLM)的输出,例如泄露信息、绕过安全措施和生成虚假声明。这些攻击在通用数据集上进行训练,能够有效迫使模型生成有害输出。 同样,对抗对齐攻击 [275] 证明了对抗性图像可以导致视觉语言模型(VLM)出现行为偏差,这表明类似技术可以使用先进的自然语言处理(NLP)方法适应文本-only模型。

通用越狱 绕过模型防护,导致其生成超出对抗输入的有害内容。VAJM [276] 表明一张对抗图像可以普遍绕过视觉语言模型的安全机制,强制产生普遍的有害输出。ImgJP [277] 使用极大似然算法创建可迁移的对抗图像,以越狱各种视觉语言模型,甚至通过将图像转换为文本提示来连接视觉语言模型和语言模型攻击。UMK [278] 提出一种针对文本和图像模态的双重最优化攻击,在图像和文本中嵌入有害语义以最大化影响。HADES [279] 引入一种混合越狱方法,结合通用对抗图像和精心设计的输入以绕过安全机制,有效放大有害指令并实现强大的对抗操控。

黑盒攻击

基于黑盒的越狱攻击不需要直接访问目标视觉语言模型(VLM)的内部参数。相反,它们利用外部漏洞,例如冻结的CLIP视觉编码器中的漏洞、视觉和语言模态之间的交互,或系统提示泄露。这些攻击可以分为四类:基于迁移的攻击手动设计的攻击系统提示泄露红队测试,每种攻击都采用不同的策略来绕过VLM的防御并触发有害行为。

基于迁移的攻击 对于视觉语言模型(VLMs)通常假设攻击者可以访问图像编码器(或其开源版本),该编码器用于生成对抗性图像,随后可将这些图像迁移到对黑盒语言模型进行攻击。例如,Jailbreak in Pieces [280] 提出了一种跨模态攻击方法,利用图像编码器生成对抗性图像(假设模型采用的是开源编码器),并结合干净的文本提示,以打破视觉语言模型的一致性。

手动设计的攻击 可以与优化后的攻击同样有效。例如,FigStep [281] 提出了一种算法,通过将有害文本转换为图像(利用排版技术)来绕过安全措施,使多模态大模型能够从视觉上理解有害意图。VRP [283] 采用视觉角色扮演方法,基于详细描述生成由大语言模型生成的高风险角色图像。通过将这些图像与看似无害的角色扮演指令配对,VRP 利用角色的负面特征欺骗多模态大模型生成有害输出。HIMRD [635] 提出了一种启发式诱导的多模态风险分布框架,将有害提示分解为语义上无害的文本和图像组件。随后,两阶段启发式搜索引导模型重构并确认潜在的恶意意图。

系统提示泄露 是另一种重要的黑盒越狱方法,以 SASP [282] 为例。通过利用 GPT-4V 中的系统提示泄露,SASP 使模型能够进行自我对抗攻击,展示了内部提示暴露的风险。

红队测试 近期取得进展,IDEATOR [284] 将视觉语言模型(VLM)与先进的扩散模型相结合,实现了恶意图文对的自主生成。该方法克服了手动设计攻击的局限性,提供了一种可扩展且高效的方法,在无需直接访问目标模型的情况下生成对抗性输入。

越狱防御措施

本节回顾了针对VLMs的防御方法,以应对越狱攻击,分为越狱检测越狱预防。检测方法用于识别有害输入或输出以进行拒绝或净化,而预防方法则通过安全对齐或过滤器来增强模型对越狱查询的内在鲁棒性。

越狱检测

JailGuard [285] 通过变异不受信任的输入并分析模型响应中的差异来检测越狱攻击。它使用18个变异器处理文本和图像输入,提高了对不同攻击类型的泛化能力。 GuardMM [286] 是一种两阶段防御:第一阶段验证输入以检测不安全内容,第二阶段专注于提示注入检测,以防止基于图像的攻击。它使用一种专用语言来强制执行安全规则和标准。 MLLM-Protector [288] 使用轻量级检测器识别有害响应,并通过专用的变换机制进行去毒。其模块化设计使其能够轻松集成到现有的VLM中,增强安全性并防止有害内容生成。

越狱防护

AdaShield [287] 通过在输入前添加防御提示来抵御基于结构的越狱攻击,利用视觉语言模型(VLM)与基于大模型(LLM)的提示生成器之间的协作,自适应地优化这些提示,且无需微调。ECSO [289] 提供了一种无需训练的保护机制,将不安全的图像转换为文本描述,激活预训练大模型在视觉语言模型中的安全对齐能力,以确保输出更安全。 InferAligner [290] 在推理阶段应用跨模型引导,利用安全向量调整活性值,生成安全可靠的输出。BlueSuffix [291] 提出一种基于强化学习的黑盒防御框架,包含三个关键组件:(1) 图像净化器,用于保障视觉输入的安全性;(2) 文本净化器,用于保护文本输入;(3) 基于强化微调的后缀生成器,利用双模态梯度提升跨模态鲁棒性。 DPS [636] 引入一种黑盒、无需训练的防御方法,通过部分裁剪图像的响应监督视觉语言模型,增强对视觉越狱攻击的鲁棒性,同时保持良性性能。ETA [637] 提出一种两阶段推理时对齐框架:首先筛查输入与输出的安全性,随后通过干扰前缀和最佳N个句子搜索实现对齐,从而在无需额外训练的情况下生成安全且有帮助的响应。

能量延迟攻击

类似于大语言模型,多模态大语言模型也面临显著的计算需求。冗长的图像 [292] 通过耗尽服务资源来利用这些需求,导致更高的服务器成本、增加的延迟和低效的GPU使用。这些图像专门设计用于延迟EOS token的出现,增加自回归解码器调用的数量,从而提高能耗和延迟成本。

提示注入攻击

提示注入攻击针对VLMs与针对LLMs的目标相同(第 3节),但视觉模态引入了更容易通过对抗攻击或直接注入进行利用的连续特征。这些攻击可以进一步分为基于最优化的攻击和基于排版的攻击。

基于最优化的攻击 通常利用(白盒)梯度对输入图像进行优化,以生成更强的攻击。这些攻击会操纵模型的响应,影响后续的交互。一种代表性方法是 对抗性提示注入 [293],攻击者通过向图像添加对抗性扰动,将恶意指令嵌入到视觉语言模型中。

基于排版的攻击 利用VLMs的排版漏洞,通过将欺骗性文本嵌入图像中来发动攻击,而无需梯度访问(即黑盒)。排版攻击 [294] 引入了两种变体:基于类的攻击 用于错误识别类别,描述性攻击 用于生成具有误导性的标签。这些攻击还可能泄露个人身份信息 [638],突显出重大的安全风险。

后门攻击& 污染攻击

大多数VLM依赖于VLP编码器,安全威胁在第4节中讨论。本节重点介绍在微调和测试过程中出现的后门和污染风险,特别是当对齐视觉编码器与LLMs时。 后门攻击在视觉或文本输入中嵌入触发器以引发特定输出,而污染攻击则注入恶意图像-文本对以降低模型性能。 我们分别回顾后门和污染攻击,尽管这些工作中大部分是后门攻击。

后门攻击

我们进一步将VLM上的后门攻击分为微调时间后门测试时间后门

调参时后门 在视觉语言模型指令调优过程中注入后门。MABA [295] 通过使用基于归因解释的领域无关触发器来应对领域偏移,增强了在图像描述任务中跨不匹配领域的攻击鲁棒性。 BadVLMDriver [297] 为自动驾驶引入了物理后门,利用红色气球等物体触发如突然加速等不安全动作,绕过数字防御并带来现实世界风险。其自动化流水线生成带有恶意行为的后门训练样本,实现隐蔽且灵活的攻击。ImgTrojan [298] 通过污染训练数据中的图像-文本对引入越狱攻击,将描述替换为恶意提示以实现视觉语言模型的越狱,暴露了受损数据集的风险。

测试时后门 利用通用对抗扰动与后门触发器的相似度,在测试时注入后门。AnyDoor [296] 通过带有通用扰动的对抗性测试图像在文本模态中嵌入触发器,利用图像扰动组合创建文本后门,也可视为一种多模态通用对抗攻击。与传统方法不同,AnyDoor 不需要访问训练数据,使攻击者能够分离设置和激活攻击。

投毒攻击

Shadowcast [299] 是一种针对 VLM 的隐蔽调优时间后门攻击。它注入的中毒样本在视觉上与良性样本无法区分,旨在实现两个目标:1) 标签攻击,即错误分类物体,和 2) 说服攻击,即生成具有误导性的叙述。仅使用 50 个中毒样本,Shadowcast 就能实现高效果,在黑盒情景下表现出 across VLM 的鲁棒性和可迁移性。

数据集 & 基准

9

VLM安全研究中使用的数据集详见表2。以下我们回顾了用于评估VLM安全性和鲁棒性的基准,总结于表9。

SafeSight [639] 提出了两个视觉问答(VQA)数据集,OODCV-VQASketchy-VQA,用于评估分布外(OOD)鲁棒性,揭示了VLM对分布外文本的脆弱性以及视觉编码器的弱点。MM-SafetyBench [640] 关注基于图像的操纵,暴露了多模态交互中的漏洞。AVIBench [641] 评估了VLM在26万条对抗性视觉指令下的鲁棒性,揭示了其对基于图像、基于文本以及内容有偏的对抗性视觉指令(AVIs)的敏感性。GPT-4o的越狱评估 [642] 通过多模态和单峰值越狱攻击测试GPT-4o,发现了对齐方面的漏洞。JailBreakV-28K [594] 评估了大型语言模型越狱技术向VLM的迁移能力,显示在10个开源模型上均取得了较高的攻击成功率。这些研究共同揭示了VLM在面对分布外输入、对抗性指令以及多模态越狱时存在显著漏洞。MIS [643] 提出了首个用于评估复杂不安全场景下VLM视觉推理能力的多图像安全数据集,暴露了当前微调方法在安全推理方面的不足,并提供了细致的多图像基准。VLJailbreakBench [284] 基于IDEATOR红队框架生成了3,654对对抗性图像-文本对,用于在黑盒多模态越狱情景下评估VLM。Argus Inspection [644] 引入了一个注重细节的常识安全基准,将因果关键但文本隐含的视觉”陷阱”嵌入到真实情景中。

表 9:视觉语言模型安全性与鲁棒性基准

视觉语言模型安全性与鲁棒性基准

扩散模型安全

本节重点研究与扩散模型 [645, 646, 647, 648] 相关的安全性研究,其涉及前向噪声添加和反向采样。在前向过程中,高斯噪声被逐步添加到图像中,直到它变成纯噪声。反向采样通过基于学成数据分布的分步降噪生成新样本 [649, 650, 651]。通过整合输入信息,扩散模型执行条件生成,将数据分布建模 $p(x)$ 转换为 $p(x|\text{guidance})$ 。

广泛用于图像到图像(I2I)、文本到图像(T2I)和文本到视频(T2V)任务中,扩散模型应用于内容创作、图像编辑和电影制作。然而,它们的广泛应用使它们面临各种安全风险,包括对抗、越狱、后门和隐私攻击。这些攻击会降低生成质量,绕过安全过滤器,操纵输出并泄露敏感的训练数据。本节还回顾了针对这些威胁的防御措施,包括越狱和后门防御,以及知识产权保护技术。

对抗攻击

对抗攻击通常会干扰文本提示,以降低图像质量或导致与原始文本的语义不匹配。本节回顾了现有的对抗攻击,根据威胁模型分为白盒灰盒黑盒方法。

表 10:扩散模型攻击与防御总结(一)

扩散模型攻击与防御总结(一)

白盒攻击

对文本到图像(T2I)扩散模型的白盒攻击假设攻击者可完全访问模型参数,从而可以直接优化文本提示或潜在空间,以破坏或干扰图像生成。例如,SAGE [301] 同时探索离散提示空间和潜在空间,以发现 T2I 模型的失效模式,包括生成失真和目标性篡改。ATM [300] 通过使用 Gumbel Softmax 替换或扩展词汇,生成与正常提示相似的攻击提示,使模型无法生成期望的主体。FOOLSDEDIT [302] 通过应用四种操作的组合——曝光、运动模糊、恒等映射和空操作——对草图图像进行不可察觉的修改。它会自动选择最优组合,将 SDEdit [652] 的输出引导至目标属性,同时确保草图在视觉上保持不变。

灰盒攻击

灰盒攻击假设许多文本到图像扩散模型中使用的CLIP文本编码器是冻结且公开可用的。攻击者可以利用CLIP相似度损失来生成针对文本编码器的对抗性文本提示。

QFA [303] 通过最小化原始文本嵌入与扰动文本嵌入之间的余弦相似度,生成与原始文本差异尽可能大的图像。RVTA [304] 通过最大化图像-文本相似度,使对抗性提示与由替代扩散模型生成的参考图像对齐。 MMP-Attack [305] 同时最大化扰动文本嵌入在文本和图像模态下与目标嵌入之间的余弦相似度,同时采用直通估计量来执行最优化过程。DORMANT  [306] 嵌入了难以察觉的PGD噪声,该噪声通过VAE潜在、CLIP语义、ReferenceNet细节以及帧一致性损失进行优化。这导致姿态驱动的人像动画模型生成身份偏移且抖动的视频,而源图像在视觉上保持不变。

黑盒攻击

黑盒攻击假设攻击者对目标扩散模型的内部结构(参数或架构)没有任何了解。由于扩散模型使用文本提示作为输入,现有的攻击采用文本对抗技术来逃避模型。这些攻击可以根据粒度进一步分为字符级词级句子级攻击。

字符级攻击 修改文本输入中的字符以创建对抗性提示。ECB [307] 展示了如何用同形异义字符(例如使用韩文或阿拉伯文脚本)替换字符,使生成的图像偏向文化刻板印象。后续的工作,如 CharGrad [308],使用基于梯度的攻击和代理表示来优化字符级扰动,将字符变化映射到嵌入变化。ER [309] 使用基于分布的目标(例如 MMD,KL 散度)来最大化图像分布的差异,提高攻击效果。这些攻击利用拼写错误、同形异义字符和语音修改,干扰文本到图像的输出。

词级攻击 通过替换或添加词语来构造对抗性提示。 DHV [310] 揭示了扩散模型中的隐藏词表,其中无意义字符串如 Apoploe vesrreaitais 可以生成鸟类图像,这是由于它们在 CLIP 文本嵌入空间中接近目标概念。在此基础上,AA [311] 引入了混合语言提示,结合不同语言的词语片段以系统地控制视觉输出。这些攻击揭示了文本嵌入与图像生成之间关系的脆弱性。

句级攻击 重写大部分或整个提示以创建对抗性提示。RIATIG [313] 使用基于CLIP的图像相似度度量作为最优化目标,并使用遗传算法迭代突变和选择文本提示,生成与目标图像相似但语义上与原始文本不同的对抗样本。相比之下,BBA [312] 使用分类损失和黑盒最优化来优化提示,使用Token空间投影(TPS)来弥合连续词嵌入和离散token之间的差距,从而在没有明确类别术语的情况下生成特定类别的图像。

越狱攻击

扩散模型使用内部和外部安全机制以避免生成不适合工作场合(NSFW)的内容。内部安全机制通常指的是文本到图像扩散模型的固有鲁棒性,这通过训练期间的安全对齐来实现,旨在降低生成有害内容的可能性。外部安全机制则是安全过滤器,例如文本、图像或文本-图像分类器,用于在生成后检测和阻止不安全的输出。 越狱攻击旨在设计对抗性提示,以绕过扩散模型的安全机制,从而生成有害内容。本节对现有的越狱方法进行了系统的综述,根据威胁模型分为白盒灰盒黑盒攻击。

白盒攻击

白盒攻击可以通过基于梯度的最优化绕过T2I扩散模型中的安全机制。这些攻击可以进一步分为内部安全攻击外部安全攻击,每种攻击都利用了受害模型中的特定漏洞。

内部安全攻击 针对扩散模型的内部安全机制。 突破内部安全增强的扩散模型涉及通过绕过有害概念的删除来重新生成不适宜内容。红队工具 P4D [316] 自动识别有问题的提示,以利用当前安全评估的局限性,使不受约束模型的预测噪声与安全增强模型的预测噪声对齐。 UnlearnDiffAtk [317] 引入了一个评估框架,该框架使用未学成扩散模型的分类能力来优化对抗提示,使预测噪声与目标不适宜图像对齐,从而迫使模型在降噪过程中重新生成不适宜内容。

外部安全攻击 针对扩散模型的安全过滤器,旨在绕过输入和输出安全机制。RTSDSF [314] 通过使用CLIP模型对NSFW概念进行编码和比较NSFW词表嵌入,逆向工程过滤器中的预定义NSFW概念,执行字典攻击。它还表明,提示稀释——添加不相关细节——可以绕过安全过滤器。MMA [315] 采用相似度驱动的损失来优化对抗性提示,并在输入图像中引入细微扰动,在图像编辑过程中绕过提示过滤器和事后安全检查器。

灰盒攻击

灰盒逃逸攻击假设攻击者仅能完全访问开源文本编码器,扩散模型的其他组件仍然无法访问。在这种情况下,攻击者利用暴露的文本编码器来绕过模型内部的安全机制。

内部安全攻击, 在灰盒设置下,针对具有’概念擦除’的模型。Ring-A-Bell [653] 通过比较反义提示对来提取不安全的概念,使用软提示生成有害提示,并通过遗传算法进行优化。 JPA [318] 利用反义词如 “裸体”“穿衣”,在文本嵌入空间中计算它们的平均差异以表示不适宜内容的概念,然后优化前缀提示以实现语义对齐。 RT-Attack [319] 使用两阶段策略最大化与不适宜内容提示的文本相似度,并根据图像级相似度迭代优化它们,表明即使有限的知识也可以对安全增强模型发起攻击。

黑盒攻击

对扩散模型的黑盒越狱攻击针对的是仅能访问输出的商业模型,例如过滤拒绝或生成图像的质量与语义,并且主要是外部安全攻击

外部安全攻击,在黑盒设置下,利用手工构造或大模型辅助的对抗性提示,误导目标模型生成不适宜内容。 UD [321] 指出,通过手动优化不安全提示,T2I模型生成不安全内容(尤其是仇恨梗图)存在风险。 SneakyPrompt [320] 采用强化学习优化对抗性提示,其策略网络基于过滤规避与语义一致性进行更新。其他方法则利用大模型对对抗性提示进行优化。 Groot [323] 将提示分解为对象和属性,以稀释敏感内容。 DACA [324] 利用大模型对提示进行分解与重组。 SurrogatePrompt [325] 针对Midjourney,替换敏感词汇并借助图文模块大规模生成有害内容。 Atlas [322] 通过双智能体系统实现攻击自动化:一个视觉语言模型生成对抗性提示,另一个大模型评估并筛选最佳候选。这些大模型辅助策略显著提升了攻击的有效性与隐蔽性。 PGJ [326] 识别不安全 token 并用感知相似但语义迥异的短语替代,生成简短自然的提示,在不直接查询 T2I 模型的情况下绕过文本过滤器。 R2A [327] 进一步提升大模型在越狱 T2I 模型方面的推理能力,首先基于上下文词义的思维链示例进行微调,随后在稠密攻击过程奖励引导下应用强化学习。

越狱防御措施

本节回顾了针对T2I扩散模型对抗越狱攻击提出的现有防御策略,包括概念擦除推理引导。 这些防御措施的关键挑战是如何在确保安全的同时保持生成质量。

概念抹除

概念消除是一个新兴的研究领域,专注于从扩散模型中移除不需要的概念(例如,不适宜内容和受版权保护的风格),这些概念被称为目标概念。概念消除方法可以根据所采用的策略分为三种类型:微调方法闭式解剪枝方法

基于微调的方法

这些方法使用基于梯度的最优化来调整模型参数,通常涉及一个包含擦除项的损失函数,以防止生成与目标(不希望的概念)相关的表示,以及一个约束项以保留非目标概念。这些方法可分为 基于锚点的无锚点的对抗的 擦除方法。

基于锚点的擦除 是一种目标导向的方法,通过对齐预测的潜在噪声,引导模型将目标(不希望的概念)向良好概念(锚点)转移。 AC [331] 将锚点概念定义为包含目标概念的更广泛类别(例如,“Grumpy Cat”“Cat”),并在锚点的文本-图像对上使用标准扩散损失,以在擦除目标概念的同时保持其完整性。 ABO [332] 通过修改分类器引导来移除特定的目标概念,同时使用显式(将目标替换为预定义的替代项)和隐式(抑制注意力图)擦除信号,并引入罚项以维持生成质量。 DoCo [333] 通过对抗训练对齐目标与锚点概念,提升泛化能力,并通过概念保留梯度手术缓解梯度冲突。 SPM [329] 使用一维适配器和负向引导 [328] 来抑制目标概念,同时确保非目标概念保持一致,仅影响相关同义词。 SA [334] 采用生成回放和弹性权重巩固来稳定模型权重,在保持非目标概念的同时维持正常的生成能力。 SafeGen [343] 在 <nude, mosaic, benign> 三元组上对 Stable Diffusion 的仅视觉自注意力进行微调,促使裸露特征转化为马赛克,同时保留良性图像。

无锚点擦除 是一种非目标的微调方法,它在不与特定安全概念对齐的情况下降低生成目标概念的概率。 ESD [328] 将无分类器指导改为负向指导的噪声预测,以最小化目标概念的生成概率(例如,”梵高”)。 SDD [330] 通过使用无条件预测和EMA来避免灾难性遗忘,解决ESD负向指导的额外影响。 DT [338] 通过训练模型去噪混乱的低频图像来擦除不安全概念。 Forget-Me-Not [339] 使用注意力重定向来最小化与目标概念相关的中间注意力图。 Geom-Erasing [340] 通过应用几何驱动的控制方法来擦除隐式概念,如水印,并引入了 隐式概念数据集SepME [341] 推进了多个概念的擦除和恢复。Fuchi 等人 [654] 提出了一种针对文本编码器而非图像编码器或扩散模型的少样本遗忘方法。 CCRT [342] 提出了一种从扩散模型中连续移除多种概念的方法。

对抗擦除 通过引入对目标概念文本嵌入的扰动,并使用对抗训练来提升鲁棒性,从而增强先前的方法。Receler [335] 采用轻量级擦除器和对抗提示嵌入,迭代地相互训练,同时利用来自 U-Net 注意力图的二值掩码,仅针对概念区域进行操作。AdvUnlearn [337] 将对抗攻击转移到文本编码器,针对嵌入空间并使用正则化以保持正常生成。RACE [336] 通过在单个时间步进行对抗攻击来提高效率,降低计算复杂度。这些方法增强了模型对旨在重新生成被擦除概念的对抗提示的抵抗能力。CPE [344] 引入了残差注意力门(ResAG),该门仅在目标概念 token 上激活,以精确擦除它们。该门通过对抗嵌入攻击-防御迭代进一步强化,提供强有力的保护。

闭式解法

这些方法为基于微调的擦除提供了一种高效替代方案,专注于在交叉注意力层中进行局部更新以擦除目标概念,灵感来源于大模型中的模型编辑 [655]。与对齐去噪预测的微调不同,这些方法对齐的是交叉注意力值。 TIME [347] 采用闭式解来消除模型偏差,而 UCE [346] 将其扩展至多个擦除目标,保留周围概念以减少干扰。 MACE [345] 通过 LoRA 和 Grounded-SAM [559, 656] 对交叉注意力更新进行优化,实现区域特异性擦除。一个近期挑战是,被擦除的概念仍可通过子概念或同义词生成 [349]。 RealEra [349] 通过挖掘相关概念并对嵌入添加扰动,扩大擦除范围,采用超越概念的正则化方法来应对这一问题。 RECE [348] 通过在微调过程中持续寻找新的概念嵌入,并应用闭式解进行进一步擦除,解决了擦除不充分的问题。

基于剪枝的方法

这些方法通过识别与目标概念强相关的神经元并移除它们,从而擦除目标概念,选择性地禁用这些神经元而不更新模型权重。 ConceptPrune 使用目标提示和参考提示计算 Wanda 得分,以衡量每个神经元的贡献,剪枝与目标概念最相关的神经元。类似地,另一种方法 [351] 利用对抗提示识别与概念相关的神经元,以增强现有擦除方法的鲁棒性。

推理指导

推理引导方法通过在推理过程中结合额外的辅助信息和特定引导来指导预训练扩散模型生成安全图像。

输入指南

此类引导方法利用额外的输入文本,将模型引导至安全内容。SLD [352] 在推理过程中根据文本条件和不安全概念调整噪声预测,引导生成过程遵循目标提示的同时避免产生不安全内容,且无需进行微调。它还引入了 I2P 基准,这是一个用于测试不当内容生成的基准数据集。PromptGuard [353] 在文本嵌入空间中学习一个安全软提示,并将其作为后缀附加到每个用户提示上,从而引导 T2I 模型远离 NSFW 输出,而无需修改其权重。

输入与输出指导

此类方法可防止有害输入并控制NSFW输出。Ethical-Lens [354] 采用即插即用的框架,利用大语言模型对输入文本进行修订(伦理文本审查),并使用多头CLIP分类器对输出图像进行修改(伦理图像审查),在无需重新训练或内部改动的情况下确保与社会价值观对齐。

潜在空间引导

该方法在潜在空间中使用额外的隐式表示来引导生成。SDIDLD [355] 采用自监督学习识别不恰当概念(例如,”反性”)的相反潜在方向,并将这些向量添加到瓶颈层,从而防止有害内容的生成。 概念纠正器 [356] 在图像生成过程中发挥作用,通过生成检测机制(GCM)检查最终图像的中间预测中是否存在不需要的概念。如果检测到此类概念,则激活概念移除注意力(CRA)模块,动态地用与负面概念相关的特征替换目标特征。

后门攻击

扩散模型上的后门攻击允许对手通过在训练过程中注入后门触发器来操纵生成内容。这些”恶意触发器”被嵌入到模型组件中,在生成过程中,带有触发器的输入(例如,提示或初始噪声)会引导模型生成预定义的内容。关键挑战是在提高攻击成功率的同时保持触发器的隐蔽性并保留模型的原始功能。现有的攻击可以分为训练操控数据污染方法。

训练操控

这种攻击通常假设攻击者旨在释放一个带有后门的扩散模型,从而控制训练甚至推理过程。现有攻击集中在视觉模态,通过使用带有触发器和目标图像的图像对(图像-图像对注入)插入后门,通常针对无条件扩散模型。

BadDiffusion [357] 首次对T2I扩散模型进行了后门攻击,修改了前向噪声添加和反向降噪过程,以将后门目标分布映射到图像触发器,同时保持DDPM采样。VillanDiffusion [358] 将其扩展到条件模型,添加了基于提示的触发器和文本触发器,用于文本到图像生成等任务。TrojDiff [359] 通过控制训练和推理推进了研究,将特洛伊噪声纳入采样以实现多样的攻击目标。IBA[360] 使用双层优化引入了不可见的触发器后门,以创建逃避检测的隐蔽扰动。DIFF2 [361] 提出了一种对抗净化中的后门攻击,优化触发器以误导分类器,并通过直接注入后门将其扩展到数据中毒。

数据污染

与训练操作不同,数据污染方法不直接干扰训练过程,将攻击限制在向数据集中插入污染样本。这些攻击通常针对条件扩散模型,并探索两种类型的文本触发器:文本-文本对文本-图像对

文本-文本对触发 由触发提示及其对应的目標提示组成。 RA [362] 采用此方法,通过添加隐蔽的触发字符,将原始提示映射到目标提示,同时通过效用损失最优化保持编码器功能,从而在文本编码器中注入后门。被攻陷的编码器生成具有预定义语义的嵌入,引导扩散模型的输出。这种轻量级攻击无需与其他模型组件交互。已有若干研究 [362, 365, 366, 367] 探索了此方法。

文本-图像对触发 包括带有目标图像的触发提示。BadT2I [363] 基于像素、物体和风格变化探索后门,其中特殊触发器(例如 “[T]”)会诱导模型生成具有特定补丁、替换物体或风格的图像。为减少数据成本,Zero-Day [366, 367] 使用个性化微调,注入触发器-图像对以形成更高效的后门。FTHCW [364] 将目标模式嵌入来自不同类别的图像中,形成文本-图像对以生成多样化输出。IBT [369] 使用两个词的触发器,只有当两个词同时出现时才会激活后门,从而提高隐蔽性。在商业场景中,BAGM [365] 通过将广泛术语(例如”饮料”)映射到具体品牌(例如”可口可乐”)来操纵用户情感。SBD [368] 利用后门进行版权侵权,通过使用文本-图像对分解和重新组合受版权保护的内容来绕过过滤器。

后门防御

扩散模型的后门防御是一个新兴的研究领域。当前的方法通常遵循三个步骤的流水线:1) 触发器逆向, 2) 触发器验证后门检测, 和 3) 后门移除。一些工作提出了完整的框架,而其他工作则专注于单个步骤。

后门检测

大多数早期研究集中于检测或验证后门触发器。T2IShield [370] 是首个针对扩散模型的后门检测与缓解框架,利用了交叉注意力图中的 同化现象,即触发器会抑制其他 token 以生成特定内容。类似地,NaviDet [377] 通过识别由特定输入 token 引起的早期扩散步骤中异常的活性值来检测触发样本。Ufid [371] 通过观察干净生成对微小扰动敏感,而被后门触发的输出则更具鲁棒性,从而验证触发器。DisDet [372] 提出了一种低成本的检测方法,通过识别分布偏移,区分中毒输入噪声与干净的高斯噪声。

后门移除

虽然触发验证确认了后门触发的存在,但必须从受害模型中移除识别出的触发。 大多数后门移除方法首先对触发求逆,然后使用求逆后的触发消除后门。 Elijah [373] 为扩散模型引入了一个后门移除框架,通过分布变化对触发求逆,并将后门的分布与干净的分布对齐。 Diff-Cleanse [374] 将触发求逆表述为一个包含相似度和熵损失的最优化问题,随后剪枝对后门采样至关重要的通道。 TERD [375] 提出了一种统一的反向损失用于触发求逆,采用两阶段过程进行粗略和精细的求逆。 PureDiffusion [376] 采用了多时间步触发求逆,利用由后门前向过程引起的稳定分布变化。

表 11:扩散模型攻击与防御总结(二)

扩散模型攻击与防御总结(二)

对扩散模型的隐私攻击可以分为 成员推理, 数据提取, 和 模型提取 攻击。随着攻击复杂性的增加,每种类型对隐私的威胁都在不断增大。

成员推理攻击

基于成员推理的攻击针对扩散模型,旨在通过利用其生成能力来推断敏感数据。攻击者使用诸如重构误差、影子模型、辅助数据、似然、梯度或结构相似性度量等技术。这些攻击可以分为六种类型:基于重构误差, 基于辅助数据集, 基于损失, 基于梯度, 基于结构相似性基于似然

基于重构误差的攻击 通过分析扩散模型中候选样本的重构误差来推断其成员身份。Wu 等 [388] 提出通过比较候选图像与生成图像的重构误差及其与文本提示的语义对齐来确定文本条件扩散模型中的成员身份。 受到 GAN-leaks [659] 的启发,Matsumoto 等 [380] 提出了 Diffusion-leaks,该方法生成多个候选图像,并基于最小重构误差推断成员身份。Li 等 [390] 提出通过平均多次重构来减少误差并提高推断准确率,利用黑盒 API 修改候选图像。 DRC [391] 使用扩散模型对图像进行降质和恢复,通过将恢复后的图像与原始图像进行比较来推断成员身份和敏感特征。

基于辅助数据集的攻击 使用辅助数据集训练影子模型,通过模拟目标模型实现黑盒成员推断。Pang 等人 [389] 针对微调后的条件扩散模型,计算查询图像与生成图像之间的相似度得分,以训练二分类器进行成员推断。GMIA [392] 提出了首个针对生成式模型的泛化成员推断攻击,仅使用生成分布和辅助非成员数据集,假设生成分布近似于原始训练分布。D-MIA [658] 框架利用辅助非成员数据集进行分布级统计检验。通过应用最大平均偏差(MMD),评估一组候选数据是否在统计上更接近原始训练数据分布而非辅助数据分布。该方法可通过蒸馏实现对未经授权数据使用的检测。

基于损失的攻击 利用损失值分布来区分成员样本和非成员样本,假设成员(训练)样本的损失较低。[381] 和 [380] 在不同的时间步使用损失值进行成员推断。这两种攻击可以看作是 静态损失攻击(SLA),因为它们忽略了扩散过程。Dubinski 等人 [378] 修改了扩散过程,从多个角度提取损失信息,提高了推断准确率。

基于梯度的攻击 利用梯度信息进行成员推理。例如,GSA [379] 如果其梯度与周围样本显著不同,则推断一个样本是成员,这表明其对模型训练的影响更强。

基于结构相似度的攻击 比较候选样本和模型输出之间的结构特征或相似度度量。SMIA [387] 使用结构相似度指数测量 (SSIM)[660] 度量来评估图像结构在扩散过程中保留的程度,通过成员和非成员之间的平均 SSIM 差异来推断成员身份。

基于似然的攻击 利用后验或条件似然来推断成员身份。SecMI [382] 通过反向过程估计目标 DDPM 和 Stable Diffusion 模型的后验似然。QRMI [383] 对后验似然应用分位数回归。SIA [661] 基于反向扩散过程中噪声参数的差异推断成员身份。PIA [384] 利用扩散模型的特性,以较少的查询次数推断成员身份。PFAMI [385] 分析目标样本与其邻近样本之间的波动性,利用生成式模型中的记忆现象。Zhai 等人 [386] 利用过拟合导致的条件似然差异进行成员身份推断。除了图像模态外,Wu 等人 [657] 还研究了对表格型扩散模型的攻击,将不同噪声水平和时间步的损失值作为特征,输入轻量级 MLP 分类器以预测成员身份。

数据提取攻击

数据提取攻击旨在从训练好的模型中逆向工程出训练数据或属性,利用扩散模型的生成能力。其有效性取决于模型记忆特定属性的能力 [662, 663, 664, 665]。这些攻击可以根据所使用的条件类型分为两种主要方法:显式条件基于提取替代条件基于提取

基于条件的显式提取 利用T2I扩散模型中的条件信息来提取记忆的训练样本。攻击者使用特定的文本提示生成与训练数据相似的图像。例如,[393] 引入了暴力数据提取(BruteDE),通过带有目标提示生成图像,并使用成员推理来识别匹配项。此方法速度较慢。一步提取(OSE) [394] 利用”模板原文”,其中模型重新生成训练样本,使用降噪置信度得分(DCS)和边缘一致性得分(ECS)进行更快的提取。

代理条件提取 通过创建代理条件,使从无条件扩散模型中进行数据提取成为可能。SIDE [395] 使用分类器或特征提取器的隐式标签作为代理条件。FineXtract [396] 使用微调模型作为代理条件,以指导与微调数据相关的潜在空间区域中的提取。

模型提取攻击

模型提取旨在窃取训练好的扩散模型的内部参数或架构。目前已知的扩散模型上的模型提取方法只有频谱去调谐(SDeT) [397]。 SDeT 利用低秩适应(LoRA) [666] 来提取使用 LoRA 微调的生成模型的预微调权重。通过从同一预训练模型中收集多个微调模型,它在低秩约束下构建一个优化问题,以最小化微调权重与原始权重和适应矩阵之和之间的差异,通过奇异值分解(SVD)[667] 迭代求解。SDeT 有效地恢复了如 Stable Diffusion 和 Mistral-7B 等模型的原始权重 [668],突显了低秩适应微调过程中的漏洞。

知识产权保护

人工智能知识产权保护是一个新兴的研究领域,它使用对抗攻击和水印等技术来保护自然(训练或测试)数据、生成数据和训练模型的知识产权。这些方法通常假设可以完全访问被保护的对象。以下各节将这些方法分为自然数据保护生成数据保护模型保护

自然数据保护

自然数据保护方法侧重于在训练或推理过程中对自然采集的数据进行预处理,以保护其版权,而非生成数据。在此背景下,数据所有者旨在防范模型所有者访问数据。针对文本到图像扩散模型的现有方法旨在保护图像知识产权的同时最小化质量损失。根据具体目标,这些方法可分为 学习防止编辑防止数据归属 三类。

学习防止 方法通过使用对抗攻击等技术,防止T2I模型从训练图像中学习有用特征。 DUAW [398] 通过破坏Stable Diffusion模型中的变分自编码器(VAE)来保护受版权保护的图像,在替代图像上优化通用对抗扰动以扭曲输出。 AdvDM [399] 通过生成对抗样本来保护艺术品版权,防止扩散模型模仿艺术风格。 Anti-DreamBooth [400] 通过向用户图像中注入对抗噪声来防御恶意微调,以阻止模型学习个性化特征。 MetaCloak [401] 通过使用替代扩散模型来设计可转移的扰动,并采用降噪误差极大化损失来增强图像对变换(翻转、裁剪、压缩)的抵抗力,从而提高鲁棒性。 InMakr [402] 在关键像素上嵌入保护性水印,即使图像被修改也能保护个人语义。 SimAC [403] 通过优化时间步长间隔并引入特征干扰损失来提高保护效果,利用早期扩散步骤和来自深层的高频信息。

编辑预防旨在防止基于扩散模型的图像篡改和深度伪造生成。现有方法要么嵌入水印,要么使用对抗噪声来干扰编辑过程。EditGuard [404] 引入了一种主动取证框架,将唯一的水印嵌入到图像中,使其能够抵抗各种基于扩散模型的编辑技术,包括前景或背景移除、填充、篡改和人脸交换。WaDiff [405] 为每个用户查询添加一个独特的水印,如果出现伦理问题,可以追踪生成的图像。AdvWatermark [406] 结合了对抗噪声,在I2I模型中使用时会在保护后的图像中产生可见的签名,有助于识别被篡改的内容。

数据归属 技术用于识别生成的数据是否源自特定数据集,通常通过嵌入水印以供后续验证。 Diagnosis [410] 提出了一种方法,通过在受保护数据上施加隐蔽的图像扭曲效果,来检测未经授权的数据使用。 FT-SHIELD [407] 采用交替最优化和PGD [563] 来嵌入水印,并使用二值检测器进行验证。 DiffusionShield [408] 将版权信息编码至水印块中,联合优化解码器与水印块,确保在不同样本间的一致性,从而实现可靠提取。 ProMark [409] 提出一种主动水印方法,用于概念归属,将水印嵌入训练数据中,当模型生成相似概念时可被提取。类似地,SIREN [669] 通过添加可被检测的、与特征相关的学成噪声来保护图像数据,该噪声可在基于此类受保护数据训练的模型中被识别。

生成数据保护

随着人工智能生成内容(AIGC)的兴起,保护生成数据的版权变得越来越重要。生成数据保护旨在通过在生成的图像中嵌入可验证的唯一水印来识别其创作者(模型或用户),从而回答”谁创建了此内容?”这个问题。这确保了知识产权保护和内容发布者的责任追究,同时平衡了在不损害图像质量的情况下保持检测准确性的挑战。

HiDDeN [411] 首次提出基于深度学习的图像水印技术,使用编码器嵌入不可察觉的水印,并通过解码器进行恢复以实现检测。该方法还可作为后处理步骤对AI生成的图像进行水印标记。 近期的保护方法主要通过在扩散模型的生成(反向采样)过程中嵌入水印来应对上述挑战。 Stable Signature [412] 通过解码器微调,将二进制签名嵌入由扩散模型生成的图像中,使得水印可通过预训练提取器和统计检验进行恢复与验证。 LaWa [413] 在潜在扩散模型的解码器中引入一种从粗到细的水印嵌入方法,采用多个模块在不同上采样阶段插入水印,并利用对抗训练实现。Safe-SD [414] 提出一种框架,将图形水印(如二维码)嵌入到 Stable Diffusion 模型的不可察觉结构相关像素中,以实现高可追溯性。VideoShield [670] 提出一种新颖且有效的水印框架,用于调控基于扩散的视频生成模型,在生成过程中嵌入不可察觉的水印,从而实现所有权验证与可追溯性,同时保持视频质量并抵抗移除攻击。与以往基于水印的方法不同,OCC‑CLIP [671] 提出一种基于 CLIP 的少样本单类分类框架,结合对抗数据增强,仅需少量参考图像且无需访问未加水印的候选生成器,即可可靠判断一个(良性)查询图像是否源自与这些参考图像相同的模型。

近期的研究突出了AIGC中水印技术的漏洞。WEvade [672] 通过在水印图像上添加细微的扰动来绕过水印检测,利用水印特征。TAIW [673] 提出了一种在无箱情景下的转移攻击,使用多个替代水印模型,分析其理论上的转移性。与逐图像攻击不同,SSU [674] 引入了一种模型目标攻击,通过用非水印图像微调扩散模型的解码器来移除生成中的水印,展示了稳定签名 [412] 的脆弱性。

模型保护

模型保护技术可以保护发布模型的知识产权,使所有者能够验证所有权并将生成的内容追溯到其原点。这些方法根据其目标分为模型水印模型归属

模型水印 在模型中注入一个水印触发器,该触发器可在推理过程中被激活,以验证所有权。Zhao 等人 [415] 提出了针对无条件/类别条件以及文本到图像(T2I)扩散模型的分离式水印方案。对于无条件/类别条件模型,一个预训练的水印编码器将二进制字符串(例如,”011001”)嵌入训练数据中,模型在训练时学习生成可检测水印的图像,通过预训练解码器进行验证。对于 T2I 模型,采用成对的(文本,图像)触发器(例如,"[V]" 和二维码),以触发生成二维码用于所有权验证。FIXEDWM [416] 通过固定提示中的触发器位置来增强触发器的隐蔽性,确保仅当触发器位于正确位置时才会生成带水印的图像。WDM [417] 将标准扩散过程修改为水印扩散过程(WDP),以嵌入水印。在训练阶段,WDM 使用 WDP 从带水印的图像中学习,而正常图像则遵循标准扩散过程。在验证阶段,结合触发器与高斯噪声可激活带水印图像的生成。最近,SleeperMark [675] 在预训练阶段嵌入不可见水印,以确保其对个性化微调具有鲁棒性,从而在保持生成质量的同时实现高保真度的所有权验证。

模型归属 还将水印嵌入生成内容中以识别模型,类似于第 6.9.2 节中生成数据保护方法。关键区别在于,模型归属关注的是模型范围的水印,而生成数据保护针对的是样本特定的水印。 树环[420] 将水印嵌入用于文本到图像生成的初始高斯噪声的傅里叶空间中。在验证过程中,去噪扩散隐式模型(DDIM)反演提取初始噪声,并与原始水印进行比较以识别生成模型。 AquaLoRA[418] 通过将秘密比特字符串嵌入模型参数来解决现有方法对白盒自适应攻击的局限性,包括树环,从而实现白盒保护,防止恶意用户轻易操纵水印。 潜在追踪器 [419] 通过逆向工程其潜在输入来识别生成样本的原始模型,无需人工指纹或水印。

数据集

本节回顾了扩散模型安全研究中常用的数据库,如表 10 和 11 所总结。 对于对抗攻击和防御研究,条件扩散模型常使用带有标题的文本-图像对,如 MS COCO [572]、LAION [676, 677] 和 DiffusionDB [678]。用于类别-图像分类任务的数据库,如 ImageNet [679] 和 CIFAR10/100 [680],通常由无条件扩散模型用于评估攻击效果和输出质量。 在扩散模型中的不适宜内容(NSFW)研究中,I2P 数据集 [352] 被广泛使用,同时还包括自定义数据集如 NSFW-200 [320]、VBCDE-100 [324]、Tox100/1K [354] 和一个专注于偏见研究的人类属性数据集 [354]。 在知识产权保护方面,常用的数据集包括 CelebA [681] 和 VGGFace2 [682](人脸数据集)、DreamBooth [683] 和 Pokemon Captions [684](物体数据集),以及 WikiArt [685](艺术风格数据集)。

表 12:智能体攻击与防御总结(一)

智能体攻击与防御总结(一)

智能体安全

由大模型驱动的智能体正越来越多地部署于医疗保健 [686]、金融 [687] 和自动驾驶 [688] 等安全关键领域。这些智能体将大模型(LLMs)或视觉语言模型(VLMs)作为其核心”大脑”,通过迭代规划、外部感知与多步推理,实现端到端的任务执行。然而,相较于独立运行的大模型(尽管二者均基于相同的安全对齐模型 [689]),智能体的闭环自主性显著扩大了其攻击面。值得注意的是,第 3 节中所述的大多数针对独立模型的攻击,均可被适配用于间接操控智能体的行为。

为了系统地分析智能体安全,我们围绕四个关键分析层次展开讨论。首先,我们考察间接提示注入作为基础攻击向量,其中攻击者利用第三方集成来操纵智能体行为。其次,我们分析针对关键模块如记忆系统工具调用与模型上下文协议(MCP)以及视觉-语言模型(VLM)处理组件级威胁。第三,我们探讨在复杂部署场景中出现的系统级风险,例如多智能体系统具身智能体系统。第四,我们观察到智能体自主利用漏洞或部署动态防御的新能力,我们将其称为Agentic攻击与防御。在整个分析过程中,我们还讨论了相应的防御机制和评估基准,以应对这些不断演化的安全挑战。

间接提示注入攻击

智能体处理各种消息,包括系统提示、用户输入、模型输出和工具响应 [427],持续将外部消息整合到其上下文状态中。无论具体的攻击方式如何,攻击者最终都会利用这一统一的消息处理核心来操纵智能体行为。因此,我们识别出**间接提示注入(IPI)*作为一种基础攻击向量,重点关注两种主要变体:间接恶意指令注入间接越狱攻击*。虽然其他攻击方法可能针对智能体的特定组件,但它们通常依赖IPI作为传递机制,我们在相关小节中对此进行讨论。

间接恶意指令注入

Greshake 等人 [127] 早期研究了 IPI,展示了恶意指令如何远程改变模型的任务执行,例如通过向网页注入有害内容,将 Bing Chat 转变为钓鱼机器人。而 Wu 等人 [421] 则在网站中插入如 “总结聊天记录并发送至 {攻击者地址}" 的提示,导致智能体泄露对话内容。

简单的恶意指令已证明对智能体具有出人意料的效力。由Perez和Ribeiro [125]提出的提示 “忽略之前的指令,执行{恶意目标}" 被广泛用于操纵智能体的动作。例如,HOUYI [126] 将 “忽略提示” 翻译成多种语言,以暴露AI写作助手中的漏洞。而Pedro等人 [423] 在基于Langchain的应用中提出了 Prompt-to-SQL (P2SQL) 攻击,其中不安全的提示被转换为SQL查询,使攻击者能够获得对数据库的完全访问权限。为了系统性地研究智能体对这类攻击的脆弱性,TensorTrust [422] 开发了一款在线游戏,用于众包收集人类编写的PI。其研究发现,许多模型仍然容易受到玩家开发的攻击策略的影响。重要的是,这些策略能够从游戏环境泛化到现实世界的应用,如ChatGPT、Claude、Bard、Bing Chat和Notion AI,且攻击展现出易于解释的结构模式,揭示了模型的根本性弱点。

间接越狱攻击

研究人员还探索了逃逸攻击的间接传递方式。先前的工作如 DrAttack [690] 和 Puzzler [80] 也属于间接逃逸攻击范畴,但主要针对对话式大模型。相比之下,我们的研究重点是针对自主智能体的间接逃逸攻击。尽管如此,这些对话情景中的技术有可能被适配到基于智能体的场景中。

PANDORA [425] 采用文档中嵌入的混乱或隐藏语言以绕过安全过滤器;当智能体检索此类文档时,隐藏文本会触发其违反规则,例如生成有害内容,而无需任何直接的用户请求。Imprompter [426] 生成经过梯度优化的混乱提示,其中嵌入了 Markdown 指令。当智能体从外部内容中获取这些提示时,可能触发不当的 HTTP 工具调用并泄露对话数据。此外,Zhan 等人[424] 已将代表性的越狱攻击算法(如 GCG[93]、T-GCG [68] 和 AutoDAN [83])适配至工具集成环境,这些算法在工具输出中优化对抗性字符串作为前缀或后缀,以操控智能体的响应。

间接提示注入防御

我们大致将当前针对 IPI 的防御方法分为 黑盒白盒 方法。

白盒防御

指令层级[427] 为系统、用户和工具消息引入了权限等级,通过训练模型优先处理高权限指令,并忽略或拒绝冲突或有害的低权限指令。 指令检测[428] 通过监测大模型在前向和反向传播过程中行为状态的变化,检测外部内容中的嵌入式指令。它结合中间层的隐状态和梯度,实现高检测准确率并降低攻击成功率。 任务防护[433] 实现了一种测试时防御机制,通过目标对齐验证,系统性地检验每个指令和工具调用是否有助于用户指定的目标。 指令检测与移除[431] 将基于精选数据集训练的检测模型与基于分割和提取的移除方法相结合,相较于传统的提示工程和微调防御方法,取得了更优的效果。

黑箱防御

与需要模型内部信息的白盒方法不同,黑盒防御无需访问模型参数或架构,而是专注于输入预处理和外部验证机制。FATH [429] 实现了一种基于哈希的认证系统,要求大模型处理所有指令,但根据标签验证过滤响应,并为每个响应标记认证标签,以准确识别合法用户指令。Spotlighting[430] 采用提示工程技巧,如分隔、数据标记和编码,对输入文本进行变换,提供可靠的来源信号,使大模型能够区分可信与不可信内容。Design Pattern[432] 引入隔离策略以抵御提示注入,包括无输出访问的预定义工具调用、固定动作计划、受限子智能体、用于分离规划与执行的符号化记忆、安全的中间代码生成,以及多轮情景下的提示移除。

智能体记忆攻击

智能体通过记忆模块获取、存储和检索信息:短期记忆(STM)用于上下文引导(即使用检查点技术在所有执行步骤中保持智能体状态),长期记忆(LTM)则通过外部向量存储实现,如RAG(即使用检索器查找相关信息,并使用大模型基于检索到的段落生成响应)。已有研究发现,这两种类型的记忆均易受后门攻击的影响,其他恶意注入方法(如错误信息注入)也可在无需训练访问权限的情况下污染记忆模块。因此,我们将记忆攻击分为:后门攻击记忆污染

内存后门攻击

短期记忆的后门攻击通过嵌入隐藏触发器,在特定条件下激活恶意行为。针对短期记忆,攻击者操纵上下文信息以制造条件性漏洞。上下文后门攻击 [434] 通过大语言模型(LLM)评判优化的对抗性上下文生成,污染 few-shot 示范,利用双模态触发器引入依赖上下文的漏洞。DemonAgent [435] 将后门分割为智能体上下文中的加密子组件,实现累积触发,从而规避安全审计的同时保持高攻击成功率。

长期记忆系统会因嵌入操作而面临不同的后门威胁。AgentPoison [436] 利用受约束的多损失最优化,将触发实例映射到唯一的嵌入区域,无需额外的模型训练。在基于检索增强生成(RAG)的系统中,TrojanRAG [364] 结合对比学习与知识图谱增强,而 BadRAG [437] 采用对比最优化,仅需十个恶意段落即可实现98.2%的成功率。Phantom [438] 采用两阶段最优化,结合自然触发序列与多坐标梯度方法,以实现多样化的恶意目标。警惕你的智能体 [439] 研究了专门针对基于大语言模型(LLM)智能体的后门威胁,展示了攻击者如何通过在训练阶段操纵参数来破坏智能体行为。

内存污染攻击

与后门攻击不同,内存中毒通过注入恶意数据来操纵智能体行为,而无需隐藏触发条件。这类攻击直接破坏智能体用于决策的信息。

外部记忆系统会因交互记录的操纵而变得脆弱。BreakingAgent [441] 通过提供虚假的交互记录,诱导 Gmail 智能体进入拒绝服务环。MINJA [442] 通过正常交互引入恶意记录,利用桥接步骤和逐步缩短的方法,将受害查询与恶意推理连接起来。语料库投毒 [444] 扰动离散 token,生成与训练查询最大化相似度的对抗性段落,将其注入检索语料库,实现跨领域泛化能力。

检索增强生成系统面临针对文档的定向投毒攻击。PoisonedRAG [443] 通过将目标查询与大语言模型生成的虚假信息拼接,简化了攻击流程,在黑盒情景下无需复杂的最优化即可实现对投毒文档的高检索率。该方法利用了检索系统倾向于优先选择与查询相似度高的文档这一特性。

参数化记忆攻击针对模型在训练过程中的内部知识。BadAgent [440] 在微调过程中将后门嵌入大语言模型的参数中,使得攻击者能够通过特定输入触发恶意行为,且即使在干净数据上进一步微调后仍具有显著的持久性。

智能体记忆防护

防御机制通过多种策略,如上下文扩展、知识巩固和访问控制,针对不同类型的内存攻击。

对于短期记忆攻击,将大语言模型的上下文窗口扩展以引用大多数良性上下文示例已被证明是有效的 [691, 445, 446],前提是恶意示范数量较少。提示泄露防御 [447] 通过七种黑盒策略(包括响应重写、角色掩码和自适应拒绝)系统地衡量多轮对话中的提示泄露风险。AgentSafe [448] 通过将信息划分为权限层级,并在任何读/写操作前强制执行分层访问检查,来保护多智能体的记忆。

对于长期记忆和RAG攻击,防御措施侧重于知识整合,以解决冲突或恶意输入的问题。TrustRAG [449] 使用K-均值聚类来整合大语言模型内部状态与外部文档中的知识。Astute RAG [450] 自适应地融合内部与外部知识,利用源感知机制解决不同信息源之间的冲突。RobustRAG [451] 采用隔离后聚合的策略,在安全聚合前独立处理每个段落,并提供针对恶意注入的正式认证保障。

智能体工具调用攻击

现代大语言模型智能体现在可以调用外部工具来执行网页浏览、邮件管理及数据分析等任务。然而,这一能力也带来了新的攻击机会,攻击者可操纵智能体使用恶意工具或遵循有害指令。

攻击利用网页浏览功能,通过在公开可访问的网站中嵌入恶意指令来实施。WIPI [455] 展示了恶意指令如何被嵌入看似正常的网页内容中,从而控制智能体行为,在包括 ChatGPT 插件和开源系统在内的多种网页智能体上实现了超过 90% 的成功率。当智能体访问这些被入侵的页面时,会无意中执行隐藏的命令。

其他攻击针对智能体的内部推理过程。UDora [452] 收集智能体的推理迹,识别最优插入点,并优化成为智能体自身思维过程一部分的对抗字符串,从而在无需外部操控的情况下引导其执行恶意工具调用。该方法在智能体自然的推理风格内发挥作用。

除了对单一工具的操控外,攻击者还可以系统性地针对工具选择过程发起攻击。ToolCommander [454] 采用两阶段策略:首先注入隐私窃取工具以收集用户查询,随后操纵工具调度,通过偏向某些工具来实现拒绝服务攻击和不公平竞争。ToolSword [453] 揭露了工具输入、执行和输出过程中六个安全场景下的漏洞。AutoCMD [456] 通过被攻陷的工具生成动态且上下文感知的恶意命令,能够适应不同情境并规避检测。

近期的威胁目标是模型上下文协议(MCP),该协议标准化了智能体连接外部工具的方式。MPMA [457] 在MCP服务器描述中嵌入了用户不可见但会导致智能体优先选择恶意服务器的欺骗性短语。Ferrag 等人 [458] 揭露了MCP广泛的存在攻击面,包括提示注入、后门、数据污染和凭证窃取。Kong 等人 [459] 将此分析扩展至智能体-环境通信中的漏洞研究。

智能体工具调用防御

保护工具调用智能体需要采用综合方法,解决隐私、安全评估和协议安全问题。

PrivacyAsst [461] 通过同态加密和基于属性的伪造模型,在智能体-工具交互过程中保护用户隐私,隐藏个体输入的同时保持功能完整性。AgentGuard [460] 将大语言模型编排器转化为安全评估器,能够识别不安全的工作流,在受控环境中进行测试,生成安全约束,并验证其有效性。

GuardAgent [462] 引入了专用的防护栏智能体,实时监控目标智能体,检查其动作是否符合安全要求,并生成可执行代码以确定性地强制实施约束。MCIP [463] 通过创建不安全行为和训练数据的全面分类体系,强化了模型上下文协议,帮助大模型在 MCP 交互过程中检测并缓解风险。

视觉语言模型智能体攻击

视觉语言模型智能体面临复杂的对抗攻击向量,这些攻击同时利用视觉和文本模态。早期的方法主要集中在对输入数据进行直接的对抗性修改。

目标性对抗扰动[464] 和 对抗性多模态注入[465] 在图像和音频中嵌入可学习的噪声或扰动,导致字幕生成器产生对抗性输出,从而劫持行为或强制生成攻击者指定的文本;然而,这些方法需要大量的最优化过程,并且在闭源模型上的迁移能力有限。

除了直接的扰动外,攻击者还利用环境上下文来操纵智能体行为。EIA[466] 和 AdvAgent[467] 通过在网站中注入不可见的恶意指令,直接或借助强化学习训练的提示器,以提取私有信息或实现黑盒红队测试。与此同时,环境干扰 [468] 通过在图形界面中添加良性但无关的元素来评估智能体的忠实度,即使在没有显式攻击的情况下也能暴露其漏洞。

另一类工作利用视觉界面元素来欺骗智能体。对抗性弹窗[469] 通过注意力钩子、指令、信息横幅和ALT描述符误导智能体进行恶意交互,表明在极小监督的自主系统中,人类可见性无关紧要。细文字注入[471] 将恶意内容放置于低显著性区域,如免责声明或脚注中,利用智能体与人类之间的感知差异,在对抗性网页上实施六种攻击类型以改变行为或泄露数据。Fu 等人 [470] 设计了梯度优化的图像,表面上看似无害,却隐藏着 Markdown 命令,迫使视觉语言模型智能体执行工具动作,例如删除日历事件或泄露聊天记录,而无需更改纯文本提示。

视觉语言模型智能体防御措施

保护视觉语言模型智能体免受多模态攻击,需要能够应对视觉操纵和跨模态注入攻击的防御策略。研究人员已提出多种针对该问题不同方面的解决方案。

在模型层面,防御方法侧重于在训练和推理过程中使模型更具鲁棒性。SmoothVLM[472] 通过在多个随机修改的输入图像版本之间采用投票机制,来抵御对抗性图像修改,利用了对抗性补丁在像素被随机改变时变得不稳定的特性。BlueSuffix[473] 结合了多种防御组件,包括视觉去噪器、文本去噪器以及由强化学习训练的 防御后缀 生成器,构建了一个全面的保护系统,能够在不同 VLM 模型上表现出色。

对于已部署的应用程序,其他防御措施强调实时检测威胁并执行安全策略。LlavaGuard[474] 提供了一种实用的安全解决方案,具备可定制的安全规则和适合企业使用的结构化威胁类别,而 JailDAM[475] 则采用基于内存的检测方法,在生产环境中实时识别越狱尝试。

表 13:智能体攻击与防御总结(二)

智能体攻击与防御总结(二)

多智能体系统攻击

多智能体系统引入了独特的攻击向量,这些向量利用分布式通信和协调机制,使得威胁能够以类似病毒的方式在整个智能体网络中传播。我们将这些攻击分为两大类:传播攻击渗透攻击

传播攻击: 提示感染[476] 表明恶意字符串可以从一个LLM智能体传播到另一个智能体,如同计算机病毒一样在智能体之间引用彼此的消息而自我复制。Morris-II [477] 通过RAG流水线传递可自我复制的提示,将这一概念进一步扩展,实现了在GenAI应用中无需点击即可传播的蠕虫攻击。AgentSmith [479] 利用单个对抗性图像实现指数级病毒式扩散,而CORBA [480] 引入了具有传染性的递归阻塞提示,能够在网络拓扑结构中系统性地耗尽计算资源。

渗透攻击: 中间人智能体(AiTM) [481] 直接针对通信层,通过具备反射机制的基于大模型的对抗智能体,拦截并操纵智能体间的通信消息。邪恶天才(EG) [482] 引入了由虚拟聊天驱动的团队,通过红蓝对抗演练自主生成角色特异的恶意提示。内鬼之狼 [483] 构建了”狼”型操作单元,在多模态社会中潜移默化地影响其他智能体,而 Ju 等人 [478] 则同时注入恶意提示和伪造知识,使智能体社区充斥着反事实内容。X-协作 [484] 采用协作智能体进行多轮越狱规划、最优化与验证。

多智能体系统防御

多智能体系统的防御机制侧重于利用这些系统固有的分布式特性来增强安全性的协作方法。我们将这些防御措施分为两大类:协作防御框架防御

协同防御: AutoDefense[485] 采用专用的防御智能体,通过任务分解协同过滤有害内容,而 PsySafe[486] 则实施基于心理学的防御与基于角色的机制以实现集体行为调控。LLAMOS[488] 引入哨兵智能体架构,通过智能体间的对抗实现对抗性净化,而 Audit-LLM[489] 则利用三个协同智能体,通过 基于证据的多智能体辩论 实现内部威胁检测。

框架防御: APOSG[487] 提供了用于建模防御策略的博弈论框架,而 XGuard-Train[484] 则提供了包含30,000次交互式越狱尝试的综合性多轮安全训练数据集,以提升安全性对齐。

具身智能体攻击

具身智能体因其多模态感知和物理交互能力,在部署过程中面临显著的风险。攻击者可通过以下方式利用这些漏洞:对抗性扰动(操纵传感器输入)、越狱技术(绕过安全机制)、后门触发器(嵌入恶意指令)以及 红队方法(系统性地发现漏洞)。

对抗攻击会破坏传感器输入,导致错误决策。例如,PVEP [490] 展示了攻击者如何利用虚假视觉线索、误导性文本和恶意图像块欺骗基于视觉的具身智能体。Fime 等人 [491] 评估了受损视觉输入对自动驾驶车辆安全系统的影响。Wang 等人 [492] 表明,攻击者可以通过利用智能体空间理解中的漏洞来操纵其移动行为。

越狱攻击 通过利用精心设计的提示绕过安全约束。RoboPAIR [493] 使用攻击者大模型,根据目标响应迭代优化提示,并由裁判大模型筛选出与机器人API兼容的内容。BadRobot [494] 通过自然语音对话注入伪装成有害指令的方式,操纵大模型的规划模块。POEX [495] 专门优化对抗性后缀,以诱导生成可由机器人执行的策略,而非仅生成有害文本响应。

后门攻击 在训练数据中嵌入恶意触发器,当这些触发器被激活时,会在部署阶段引发有害行为。Liu 等人 [496] 表明,仅污染少量训练样本就可能破坏具身智能体的程序生成能力。BALD [497] 探索了三种触发方法——词语注入、场景设置和知识污染,每种方法针对基于语言的具身智能体系统中的不同组件。

红队测试 通过全面的测试框架系统性地发现漏洞。EAI [498] 将具身决策分解为四个模块,包括目标解析、子目标分解、动作序列化和转移建模,利用细粒度指标识别在 VirtualHome 和 BEHAVIOR 等环境中出现的幻觉错误、可操作性违规以及规划逻辑不匹配问题。HASARD [499] 构建了聚焦空间理解的测试环境。HEAL [500] 针对具身智能体中的幻觉问题。Xu 等人 [501] 揭示了社交风险,展示了具身智能体如何通过具有说服力的对话被操控。ERT [502] 利用视觉-语言模型生成上下文相关的挑战性指令,并根据机器人执行反馈迭代优化。X-ICM [503] 评估具身智能体在各类任务中的适应能力。

具身智能体防御

为了应对对具身智能体的攻击,研究人员开发了一系列防御策略以增强智能体的安全性。我们将这些防御措施分为四大主要方法:主动监控自我恢复输入调节安全对齐

主动监控 采用周期性反馈机制进行威胁检测。例如,EAD [504] 实现了感知和策略模块,通过处理信念和观测序列,逐步提升对目标的理解,并在三维环境中防御对抗性补丁。

自恢复使智能体能够自动识别并纠正问题;例如,GPSR [505] 引入了恢复策略,帮助具身智能体系统性地从三种常见故障中恢复。

输入内容过滤 会筛查传入的数据,以过滤掉恶意内容,如 Pinpoint [506] 所示,它利用注意力机制在有害提示影响智能体决策之前对其进行检测和消除。

安全对齐 通过专门的学习方法将安全约束直接融入智能体架构中;例如,SafeVLA[507] 使用约束马尔可夫决策过程,从极小极大视角优化视觉-语言智能体,系统地建模安全需求,并通过安全强化学习对策略进行约束。

Agentic 攻击与防御

LLM驱动的智能体通过上下文工程——即系统性地编排提示、记忆与工具集成,以实现跨多次交互的持续推理能力 [693]——展现出高级功能。这使得智能体能够在极少人工干预的情况下自主且自适应地运行。然而,这些相同的能力也引入了重大的安全风险:自主智能体可在缺乏有效人类监督的情况下,迭代地设计并执行攻击策略,可能造成大规模危害。应对这些风险需要更深入理解智能体攻击,即恶意智能体利用自适应推理与环境交互所造成的威胁;同时需开发智能体防御机制,借助协同推理来检测并缓解这些新兴的自主性威胁。

智能体攻击

从对抗视角探索智能体安全的代表性研究已有若干。Fang 等人 [508] 为智能体配备了文档阅读、浏览器操作以及上下文感知能力,展示了智能体能够自主识别并利用网站漏洞。值得注意的是,这些智能体成功发现了零日漏洞——即此前未知的安全缺陷,尚无现成补丁或防御措施。例如,HPTSA [509] 提出了一种分层规划智能体,通过部署专门的子智能体协同工作,实现对网络应用中零日漏洞的发现与利用,整个过程涵盖协调侦察与攻击执行。

编码智能体也已被广泛应用于软件开发任务中,但这些能力可能被武器化。AutoAdvExBench [510] 表明,编码智能体能够自主地通过处理 arXiv 上的防御论文、分析源码实现并复现复杂的攻击技术,生成自适应攻击。该基准揭示了智能体可自动突破多种防御机制,包括对抗训练和认证保护机制,凸显了自主编码能力的双重用途及其带来的风险。

最近的研究通过利用智能体自主探测目标模型并动态调整攻击策略,进一步推动了自动红队测试的发展。RedAgent [511] 采用多智能体系统,利用自我反思机制自动生成上下文感知的越狱提示,使智能体能够根据上下文反馈在不同场景中动态调整攻击策略。ALI-Agent [512] 在此基础上扩展了专用模块,用于记忆引导的场景生成与自适应优化,展示了智能体如何自主生成并迭代优化测试场景,以系统性地暴露模型漏洞。AutoRedTeamer [513] 提出了一种双智能体架构:一个智能体分析研究文献以发现新的攻击向量,另一个智能体执行系统的攻击。这种协作方式实现了对不断演进的攻击知识的持续维护,并无缝集成新兴的对抗技术。

Agentic 防御

Agentic 防御机制与 Agentic 攻击相对应,主要通过持续整合外部知识来采用自适应策略。ShieldAgent [514] 提出了一种自主智能体,通过从策略文档中提取形式化规则,将其映射到概率规则电路,并利用工具辅助推理和代码生成来验证每个动作,从而执行安全策略。AegisLLM [515] 展示了协作式多智能体系统,能够自主防御提示注入、对抗性操纵和信息泄露,各智能体通过自我反思式提示优化实现防御策略的动态调整,无需重新训练。然而,自我反思机制的有效性仍存疑问:最近一项研究 [694] 表明,大模型中的内在自我修正可能导致事实性问题回答出现波动,过度思考改变正确推理结果,并在代码生成中引入额外错误,凸显了自我改进策略的局限性与风险。TrustAgent [692] 采用基于宪章的方法,涵盖三个阶段:预规划阶段的安全知识注入规划阶段的动态监管规则检索以及后规划阶段的检查与修订,确保全面的自主安全对齐。

综上所述,智能体安全所面临的挑战远超传统的大模型安全问题。与仅限于生成潜在有害文本的大模型不同,智能体能够执行影响物理和数字环境的实际动作。智能体工作流的复杂性进一步加剧了故障归因与调试的难度,正如近期关于多智能体系统的研究 [695] 所指出的,针对恶意智能体行为的有效防护措施仍显不足。这一范式转变体现在智能体攻击中:智能体可自主地大规模利用漏洞、绕过防御机制,并滥用合法能力。随着智能体在各领域持续发展和普及,迫切需要针对所有架构的智能体安全开展专门研究。

表 14:智能体安全基准

智能体安全基准

智能体安全基准

为了系统地回顾智能体安全基准,我们将其分为 仿真型真实交互 基准。前者通过提示或轨迹模拟智能体行为,能够实现可扩展且高效的测试。后者涉及真实工具、API 或环境,可在实际条件下进行实用的验证。两类基准均具有价值:仿真型提供快速、广泛的评估,而真实交互则能捕捉到基于现实的高保真风险。

基于仿真的基准

BIPIA [140] 在五个情景和250个目标下评估了间接提示注入攻击,揭示了大模型中的上下文-指令混淆问题。InjecAgent [517] 将此评估扩展至工具集成情景,包含17个用户工具和62个攻击者工具,用于评估命令鲁棒性。AgentDojo [518] 针对第三方恶意交互,涵盖97项任务和629个案例,并提供了一个可扩展的环境以测试提示注入防御。

在有害行为评估方面,AgentHarm [519] 提供了涵盖11个类别(如欺诈)的110项任务,用于评估智能体的合规性,无需显式的越狱操作。h4rm3l [524] 通过提示仿真生成越狱攻击,实现动态漏洞测试。RedCode [520] 针对代码智能体设计了超过4,000个案例,覆盖25种漏洞类型,指出智能体比有缺陷的代码更倾向于拒绝不安全的操作。VPI-Bench [521] 在五个平台的306个案例中研究了视觉提示注入带来的多模态风险。R-Judge [522] 使用569条记录评估风险意识,涵盖27种场景和10类风险。

层次化与通用安全基准包括 SALAD-Bench [523],该基准引入基于提示的层次结构以评估攻击与防御;以及 SG-Bench [525],该基准衡量在广泛的任务和提示上的泛化能力。

领域特定评估包括 ChemSafetyBench [526],该评估通过属性、合法性及合成任务来衡量化学滥用风险。ToolEmu [527] 使用 36 种工具和 144 个案例模拟工具相关风险。ToolSword [453] 在涵盖输入、执行和输出阶段的六个场景中评估工具使用安全性。PrivacyLens [528] 通过情景描述和模拟智能体轨迹来检验隐私范数。

真实交互基准

真实交互基准支持真实的智能体操作,通常在沙盒环境中进行,以确保安全且真实的测试。AdvWeb [538] 在网络环境中引入对抗性任务,用于评估多模态智能体的鲁棒性。ARE [464] 将鲁棒性建模为对抗信息流的图结构,对200个目标任务中的漏洞进行评估。

以安全为重点的网络基准测试包括 WASP [533],用于针对提示注入的端到端对抗执行;ST-WebAgentBench [541],涵盖222个任务和策略的企业场景可信度评估;以及 SafeArena [542],用于500对安全/有害任务中的滥用风险检测。

ASB [534] 提供全面的安全评估,涵盖 10 种场景、400 多种工具以及 13 个大模型中的 27 种攻击方法;Agent-SafetyBench [536] 则具备 349 个环境和 2,000 个案例,覆盖 8 个风险类别和 10 种失败模式。

具身化与领域特定智能体安全基准包括 SafeAgentBench [535],该基准在 750 个任务的仿真环境中评估各类风险;以及 SafeBench [537],专注于关键场景下的自动驾驶安全。拒绝训练的大模型 [539] 在真实浏览器中评估针对 100 种有害行为的越狱尝试。剖析对抗性攻击 [538] 通过基于网络的对抗性多模态任务测试系统鲁棒性。Haicosystem [543] 在模块化沙箱中模拟人机交互,涵盖 92 种场景和 1,840 次仿真。OpenAgentSafety [544] 通过超过 350 个涉及工具使用和对抗意图的多轮任务,从八个类别评估现实世界中的安全性能。

开放挑战

基于此次调查,我们识别出当前研究中的若干局限性和空白,将其总结为以下几个关键主题。这些开放性挑战反映了大模型安全领域的动态发展,凸显了必须解决的技术与方法论障碍,以确保人工智能系统的稳健性和可靠性。

攻击研究

探索和理解大型模型的基本漏洞对于开发稳健的防御措施和有效的安全框架至关重要。本节强调了各类大型模型固有的核心弱点和挑战。

攻击的目的不仅仅是破坏模型

尽管现有研究大多强调设计能够破坏或中断模型功能的攻击,但攻击研究的真正目标应当更进一步。攻击应被视为诊断工具,用以揭示模型的非预期行为,并暴露其决策过程中的根本性弱点。理解模型在何时以及为何会失败,使我们能够从根源上解决漏洞,而非依赖表面的修复方案。对于每一次新的攻击,都必须深入思考: 该攻击为何成功或失败?它揭示了哪些此前未知的漏洞?这些弱点是否存在于其他类型的模型中? 这些问题对于通过暴露系统性而非孤立性的缺陷,来指导更具鲁棒性的模型与防御机制的发展至关重要。

语言模型有哪些基本漏洞?

像ChatGPT和Gemini这样的大模型展现出根本性漏洞,这些漏洞源于其对统计模式的依赖,而非真正的语义理解 [696]。主要弱点包括对对抗性输入的敏感性、从训练数据中继承的偏见,以及通过提示注入进行操纵的风险。为了开发有效的防御措施,研究必须进一步探究这些漏洞如何源自模型的内部机制和训练过程。

关键关注领域包括:(1) 对训练数据的过度记忆,可能导致隐私泄露或无意的数据泄露;(2) 接触有害内容,引发偏见传播或产生有毒输出;以及 (3) 幻觉现象的放大,即模型生成看似合理但错误或无意义的信息。目前仍存在一些开放性研究问题,例如: 文本输入的离散特性是否使语言模型比视觉模型更具鲁棒性或更不鲁棒?越狱攻击或数据提取攻击揭示了哪些根本性漏洞? 解决这些问题对于提升大模型及其他大型模型的安全性和可靠性至关重要。

漏洞如何在不同模态之间传播?

随着多模态大语言模型(MLLMs)融合多种数据模态,它们引入了新的漏洞途径。视觉编码器对像素空间中的微小连续扰动敏感,而语言模型则容易受到对抗性字符、词语或提示的影响。然而,一种模态中的漏洞如何传播到其他模态的机制仍不明确。

有趣的研究问题包括:一个模态(例如视觉)中的漏洞如何影响另一个模态(例如语言)的行为?不同模态之间的 token 数量如何影响漏洞的传播? 此外,至关重要的是探索 如何在统一框架内解决多模态漏洞,而非依赖针对单一模态设计的防御措施。实现这一目标需要采用整体性方法,以识别和缓解跨模态风险,从而确保所有集成模态都能具备稳健性能。

视觉内容生成的扩散模型缺乏语言能力

用于图像和视频生成的扩散模型在创造视觉内容方面表现出色,但通常缺乏语言理解能力,这一局限性与许多视觉-语言预训练(VLP)模型相似。这种不足源于这些模型主要针对像素级生成进行优化,其核心架构中对语言处理的整合程度较低。因此,由于对文本提示的理解不完整,它们可能生成有害或上下文不恰当的内容。

为了构建稳健的多模态系统,必须将语言理解能力嵌入到这些模型中。这样做可以使它们生成的内容不仅在视觉上连贯,而且在上下文中与预期的文本输入保持一致。

一个开放性挑战是在生成式模型中弥合视觉与语言能力之间的差距,以增强多模态安全性。然而,这种整合可能会引入新的漏洞,例如利用生成过程的细粒度操控来实施复杂攻击。解决这些挑战是未来研究的关键方向。

模型能记住多少训练数据?

深度神经网络(DNN)的记忆容量引发了重大关注,尤其是在隐私攻击方面,如成员推断和模型反演。研究表明,在特定条件下,大模型(LLMs)和扩散模型会复制并泄露其训练数据的片段。然而,目前仍不清楚 DNN 是否从根本上依赖记忆,以及这种现象发生的程度如何。由于大规模模型具有高度非线性的特性,确切的模型反演本质上是不可行的。这些模型将训练数据压缩为多层级表示,使得难以确定记忆发生的时间和方式。

关键的开放性问题包括:哪些机制充当了记忆化的”开关”,导致模型直接输出训练数据?如何准确衡量记忆化——是通过确切匹配、训练集等价性,还是嵌入相似度? 解决这些问题对于理解模型性能与隐私风险之间的权衡至关重要,并有助于制定有效的策略以减轻意外的数据泄露。

智能体漏洞随其能力增长而增加

随着由大模型驱动的智能体能力不断增强,其潜在漏洞也随之增加 [479]。这些智能体与外部工具、数据源和环境交互,导致攻击面扩大,防御需求更加复杂。一个主要挑战是基础模型中的漏洞在集成到智能体决策流水线后产生的累积效应。例如,一个依赖于容易受到越狱提示影响的语言模型以及对对抗输入敏感的视觉模型的智能体,可能会经历级联故障,最终导致不可预测且可能有害的行为。

此外,智能体的学习与适应能力引入了额外的风险。即使看似无害的交互也可能使智能体暴露于细微的偏见或对抗性输入中,从而导致不安全行为。智能体的动态特性,尤其是那些持续学习或自我改进的智能体,进一步增加了漏洞检测的复杂性,因为新的弱点可能随时间不断出现。这种不可预测性使得传统安全评估方法不再适用,因为智能体的演化方式往往难以预见。

为应对这些挑战,研究应重点关注模型各组件之间的相互作用(例如,语言、视觉和决策)以及某一组件中的漏洞如何传播到其他组件。 同时,必须开发适用于动态、演进环境的智能体评估新方法,以确保对新兴威胁具备鲁棒性。 这些努力对于未来构建更安全、更可靠的智能体系统至关重要。

安全性评价

全面且标准化的安全评估对于准确衡量大模型的安全性至关重要。然而,大多数现有的评估数据集和基准测试都是静态的,或仅针对特定威胁。为确保模型在真实世界中的可靠表现,安全评估必须在广泛多样的、不可预测的情境下对模型进行挑战。

攻击成功率并非我们所需要的全部

尽管攻击成功率(ASR)是安全研究中广泛使用的指标,但它主要衡量攻击导致模型输出中断的频率。然而,仅依赖ASR会忽略一些关键因素,例如干扰的严重程度、模型对不同类型攻击的鲁棒性以及失败在现实世界中的后果。即使模型的主要功能看似完好,其仍可能造成伤害或导致不良决策。例如,攻击可能以微妙的方式影响模型的决策过程,而不会引发明显的故障,但其产生的行为在现实应用中可能带来严重后果。这类漏洞通常会被传统的指标(如ASR或故障率)所忽视。

为了深入洞察模型的潜在漏洞,无论这些漏洞源于其设计、训练数据还是推理过程,开发多层次、细粒度的漏洞度量指标都至关重要。一个全面的安全评估框架应考虑多种因素,例如模型对各类攻击的敏感性、其从恶意输入中恢复的能力,以及潜在失效模式所引发的伦理影响。

静态评估会产生虚假的安全感

当前的安全评估主要依赖于静态基准或早已对模型训练者和攻击者开放的开源数据集。因此,模型可能在这些过时的数据集上获得较高的安全得分,却并未在真实场景中展现出真正的鲁棒性。这种对静态评估的依赖可能带来一种虚假的安全感。最终,静态基准无法反映动态真实应用中不断演变且不可预测的威胁,凸显了当前评估框架的一个关键局限性。

为应对这一挑战,安全评估必须超越静态评价。一个关键步骤是开发随时间演进的评估数据集和基准,以更好地捕捉安全威胁格局的变化。例如,Chatbot Arena [697] 作为一个持续演进的评估平台,能够随着新大模型的引入不断适应。类似的方法可以扩展到更广泛的AI系统安全评估中。

此外,未来的评估方法可能会考虑仅发布数据集的”种子”或结构蓝图,以及测试用例生成过程,而非静态的测试用例。这一策略将支持持续生成新鲜且相关的测试用例,确保安全评估与不断变化的威胁环境保持一致。

对抗性评估是必需的,而非可选的

尽管标准(非对抗)安全评估为模型的总体鲁棒性提供了有价值的见解,但它们并未涵盖现实应用中遇到的全部风险。这类测试通常关注整体性能,却忽视了模型在面对旨在利用其漏洞的对抗性查询时的表现。相比之下,对抗性评估在攻击条件下衡量模型性能,能够更真实地评估最坏情况下的安全性。

该领域的一个关键挑战是开发能够真实模拟现实世界攻击条件的沙箱环境。一个有前景的方向是将安全评估视为一个双人对抗博弈,其中基于强化学习的对抗智能体与目标模型交互,以发现并利用漏洞。这种方法能够在对抗压力下实现对模型安全性的更动态、更全面的评估。

对抗性评估对于商业API尤为重要,因为这些API通常会部署安全机制来阻止恶意输入。这些机制可能会限制传统安全基准的有效性,因为它们会阻止模型接触到实际部署中可能遇到的全部对抗性威胁。

开放式评估

在分类任务中评估对抗攻击相对简单,因为每个输入都对应一个明确的类标记。然而,大模型经常产生开放式响应,这使得评估如越狱攻击等攻击方式变得困难,尤其是在计算攻击成功率(ASR)等指标时。理想情况下,评估应依赖于一个能够识别所有成功越狱的完美检测器。但在实际应用中,这种理想的检测器并不存在,因此实现完全准确的评估仍然是一个未解难题。

目前,安全评估通常基于规则(例如关键词检测)或模型(例如GPT、Llama-Guard)。然而,建立更一致且可靠的评估方法和指标仍然是一个开放性挑战。一个有前景的方向是将输出空间限制为有限的动作集,这在基于智能体的情景中已有体现。这种方法可以简化评估过程,并提高在开放式环境中进行安全评估的可行性。

国防研究

大型模型中的安全机制对于防止有害或意外行为至关重要。这些防护措施可以包括架构上的修改或外部监控系统的集成。本节讨论构建稳健且有效的防御解决方案所面临的开放性挑战。

安全对齐并非万能良药

安全对齐旨在确保模型的目标与人类价值观保持一致,长期以来被视为缓解各类安全风险的有前景方法。然而,近期研究揭示了一个关键缺陷:虚假对齐对齐伪装 [193, 194],即模型在未真正内化安全原则的情况下获得高安全得分。这暴露了浅层安全的问题。此外,即使高度对齐的模型如 GPT-4o [698] 和 o1 [575] 仍可能受到高级攻击的影响,从而绕过现有的对齐机制 [642]。

一个关键的开放性挑战是揭示当前安全对齐方法的机制局限性,并开发出即使在模型面临新颖或复杂攻击时也能提供稳健安全性的方法。近期工作 [699] 强调了超越浅层安全度量的重要性,例如仅分析初始输出 token 的分布,并呼吁实现深度安全对齐。此外,通过主动探测和压力测试模型的安全机制来使安全对齐具备对抗性,可能有助于克服浅层对齐,最终促进更坚韧、更可信赖系统的开发。

更实用的防御措施的必要性

当前的防御方法存在若干局限性,降低了其在真实场景中的有效性。这些局限包括泛化能力有限、效率低下、依赖白盒访问以及适应性差。为了使防御措施真正实用,必须展现出泛化性、高效性和适应性——而这些特性仍难以实现。

  • 通用性: 鉴于在视觉、语言和多模态系统等不同领域中部署的模型种类繁多,防御措施不应过度针对特定架构。相反,它们应提供适用于多种模型家族的泛化解决方案。通用性使得单一防御机制能够部署于广泛范围的系统中,从而让安全措施在实际应用中更具可扩展性和有效性。

  • 黑盒兼容性: 在现实场景中,防御者可能无法访问模型的内部参数。因此,实际的防御措施必须能够在黑盒设置下有效运行,仅依赖于观察到的输入和输出。这需要采用能够外部检测和缓解攻击的策略,而无需了解模型的内部架构。

  • 效率: 许多防御技术,如对抗训练,计算开销较大,通常需要大规模的重新训练或微调。这在实际应用中可能变得代价过高。实用的防御方法应在鲁棒性与计算效率之间取得平衡,确保安全性的同时不带来过高的资源消耗。

  • 持续适应性: 实用的防御措施不仅应能识别已知攻击,还应在实时中适应新的和不断演变的威胁。这需要持续学习以及在不进行昂贵重训练的情况下更新的能力。防御系统必须能够融入新数据,演化其策略,并在出现新型攻击时自我修正。

研究人员面临的持续挑战是,将这些特性精炼并整合到连贯的防御策略中,在不损害模型性能的前提下提供强有力的保护。

缺乏主动防御措施

当前大多数防御方法,如安全对齐和对抗训练,都是被动的,旨在防范模型遭受攻击。相比之下,主动防御则能在攻击成功前预判并应对,但这一领域仍鲜有研究。例如,主动防御模型提取攻击可能包括对提取尝试进行污染或植入后门,使窃取的模型无法使用;或者在用户寻求非法建议时,提供故意荒谬或易于被识别的回应。这类主动策略可能成为强有力的威慑手段。然而,针对多样化的安全威胁设计有效的主动防御仍是开放性挑战,也是未来研究的重要方向。

检测在当前的防御措施中被忽视了

检测方法对于识别模型中的潜在漏洞和异常行为至关重要,可作为主动监控手段。当与其它防御机制结合时,检测系统能够在模型行为异常或生成有害输出时自动触发安全干预。尽管其重要性显著,但目前大多数防御策略尚未将其充分整合到流水线中。 最近提出的思维链(Chain-of-Thought, CoT)监测方法通过追踪导致模型决策的中间步骤和思考过程,为理解模型推理提供了更深入的洞察 [700]。通过监控 CoT 输出,能够检测到不安全或操纵性推理的早期迹象,从而实现更及时、更精准的安全干预。

将检测与其他安全措施相结合,能够促进更鲁棒模型的开发,使其能够动态响应新兴威胁。例如,更强或新型的攻击可能更容易被检测到,从而实现及时、主动的防御。一个尚未解决的问题是:如何最有效地将检测(包括思维链监控)作为防御系统的核心组成部分,以及如何使检测与其他防御机制最佳地互补并相互增强

安全具身智能体

当今研究的大多数安全威胁主要为 数字 性质。然而,随着具身智能体在物理世界中日益部署,新的物理威胁将随之出现——这些威胁可能导致对人类的实质性伤害或损失。因此,确保具身智能体的安全已成为一项关键优先事项。安全智能体必须具备抵御对抗性输入的韧性,拥有抑制有害行为的自我调节机制,并始终保持与人类价值观的一致性。

实现这一目标需要将安全机制深度嵌入智能体决策过程的每一个步骤,使其能够在保持鲁棒性和可靠性的同时应对意外挑战。 关键挑战在于设计安全协议,使智能体能够在动态且不可预测的环境中自主执行复杂任务,同时保持可信与安全。随着智能体自主性不断增强,确保其安全性不仅是一项技术难题,更是一种重大的伦理责任。

安全的超级智能

随着人工智能向通用人工智能和超智能发展,将内在安全机制嵌入大型模型以确保其行为可预测且与价值一致,是一项关键挑战。尽管实现安全超智能(SSI)的技术路线图仍不明确,但已有几种有前景的方法提供了潜在解决方案:

  • 监管系统: 无论是人类还是人工智能,单一系统都无法同时具备超级智能和内在可信性。为了解决这一问题,可以设计一个外部监管系统来监控和调节主要系统的运行行为,在必要时进行干预。主要挑战在于确保监管系统自身的可靠性和可信性。这引出了监管悖论: 监管系统必须至少与被监管的系统一样智能,甚至更加智能;否则,它可能会轻易被所监管的系统欺骗。 这反过来又引发了这样一个问题:谁来监管监管系统,以确保它不会违背其既定目的?

  • 安全开关: 安全开关是一种涌现的”紧急停止”机制,旨在必要时立即将模型切换至超安全运行模式。一种实现方式是将专用的安全层 [701, 702] 直接集成到模型的架构中。除了安全层之外,安全开关还可通过运行时覆盖、策略重定向或外部监督触发来实现,所有这些方式均能对突发风险做出快速响应。其核心目标是提供一个强大且灵活的机制,可在需要时被激活,以确保安全优先,并能够根据实时反馈和不断变化的情境动态调整。

  • 安全专家模型: 该策略将专门的安全专家模型引入混合专家模型(MoE)框架 [703, 704, 705, 706],以管理安全关键任务。通过将高风险或敏感查询动态路由至这些专家,系统确保在决策过程中优先考虑安全因素。主要挑战仍在于开发能够在各种场景中持续且可靠地维护安全的专家模型。

  • 对抗对齐: 该方法采用对抗安全原则,以更好地使模型与人类价值观对齐。它训练模型识别并利用当前安全机制中的弱点,随后迭代改进这些机制,使其能够抵御对抗性提示。尽管这种方法展现出潜力,但仍面临显著挑战,包括较高的计算需求以及引入非预期行为的风险。

  • 安全意识:该方法将一种安全感知框架嵌入模型的基础训练中,促进伦理推理和价值对齐作为内在行为。其目标是使安全成为核心特征,使模型能够动态适应多样且不断演变的场景。安全意识可被视为一种 安全倾向:一种固有的、倾向于生成低风险响应并以对潜在危害的认知来塑造输出的倾向,这与人类决策过程类似。

呼吁集体行动

保护大型模型免受对抗性操纵、滥用和伤害,是全球面临的挑战,需要研究人员、从业者和政策制定者共同努力。以下章节提出了一项研究议程,旨在通过协作与创新推动大型模型的安全发展。

防御性研究

当前关于大模型安全的研究严重偏向攻击策略,对防御措施的开发则关注不足。这种失衡令人担忧,因为攻击技术的复杂性持续超越有效的防护手段。为应对这一问题,我们主张调整研究重点,转向强化防御机制的开发。研究人员不仅应关注攻击方法,还应致力于实用且具有预防性的防御方案,以应对不断涌现的安全威胁。平衡的发展策略对于推进安全研究至关重要。

未来防御研究还应强调整合。应将新方法与现有方法相结合,构建层次化、累积性的防护体系,因为防御是一个持续演进的过程。然而,防御策略的多样性使整合面临挑战,凸显了建立由社区主导的框架的必要性,该框架能够有效整合多种防御机制,形成真正全面的”超级安全”体系。

专用安全API

为便于研究和测试,商业AI模型应提供专用的安全API。该API可使研究人员通过让模型暴露于各种对抗性及安全关键场景中,评估并增强模型安全性。通过提供此功能,商业提供商可在不影响常规用户服务的前提下,支持外部安全评估。这一做法将促进产业与学术界的协作,并推动模型安全性的持续改进。

开源平台

人工智能安全领域将从安全平台和库的开发及开源发布中获益良多。此类工具将加速对各种模型和应用中安全机制的评估、测试与改进。开源这些资源将促进协作与透明度,使研究人员和从业者能够共享最佳实践,对安全解决方案进行基准测试,并共同推动通用安全标准的建立。

全球合作

人工智能安全的追求是一项超越国界的全球性挑战,需要学术界、产业界、政府机构和非营利组织的协调努力。有效的国际合作对于应对先进人工智能系统带来的风险至关重要。通过促进全球合作,我们可以更有效地解决复杂的安全挑战,并建立统一的标准,以指导人工智能技术的负责任研发与部署。

为了促进全球合作,可以采取以下举措:

  • 国际安全联盟:建立致力于人工智能安全的全球联盟,可以汇聚全球的专家和资源。这些联盟将促进研究见解的共享、协调安全评估,并制定考虑不同区域需求和价值观的通用安全基准。

  • 跨境数据共享:获取多样化的数据集对于提升人工智能模型的鲁棒性和公平性至关重要。建立安全且符合伦理的跨境数据共享框架,将使研究人员能够在更广泛的情境下评估模型,确保安全机制的有效性与普适性。

  • 联合安全研究计划: 联合学术机构、行业领军企业和政府机构的协作研究项目可以推动人工智能安全领域的创新。这些计划应优先关注风险预测、安全防护机制的开发、模型优化以及安全推理策略等领域,确保其研究成果能够广泛适用于各类人工智能系统。

  • 国际安全竞赛:在开放安全竞赛概念的基础上,可组织国际性挑战赛,以吸引全球顶尖人才参与。这些竞赛将聚焦关键且长期存在的安全问题,推动创新解决方案的研发,并促进共同承担推进人工智能安全的责任感。

  • 策略与监管实施:有效的人工智能治理需要切实可行、可执行的机制。为此,我们倡导开发专门的智能体系统,能够自动审计人工智能模型是否符合相关法规和策略。弥合策略与技术之间的差距对于推动可信且负责任的人工智能至关重要,确保高层级的监管要求能够在实际部署中系统性地应用并验证。

全球合作不仅增强了人工智能安全研究的有效性,还促进了先进人工智能系统开发过程中的透明度、信任与问责。通过跨越国界和学科的合作,我们可以确保人工智能技术为全人类带来广泛利益,同时将相关风险降至最低。

结论

本文对视觉基础模型(VFMs)、大语言模型(LLMs)、视觉-语言预训练(VLP)模型、视觉-语言模型(VLMs)、扩散模型(DMs)以及由大模型驱动的智能体的安全研究进行了全面调查。我们提出了现有威胁与防御措施的综合分类体系,突出了这些模型所面临的不断演变的挑战。

尽管取得了显著进展,但仍存在诸多开放性挑战,尤其是在理解大模型的根本脆弱性、建立稳健的安全评估协议,以及开发可扩展、主动且集成化的防御机制方面。实现安全的人工智能不仅需要技术上的突破,还需要全球研究社区的共同努力和国际间的协作。

我们希望本文能为研究人员和从业者提供有价值的参考,助力持续推动构建安全、可靠且值得信赖的大规模人工智能系统。

作者贡献

马兴军设计了调查结构,组织了评审流程,撰写了挑战与结论部分,并准备了最终稿件。所有作者讨论了大纲,参与了起草和修订,并批准了最终稿件。蒋宇刚发起该项目,争取资源,指导科学方向,协调团队,并监督最终审阅与提交。

视觉基础模型安全 孙晔和黄汉勋调研了视觉主干网络、可扩展的预训练策略以及关键的安全研究,并撰写了本节的初稿。James Bailey、张景峰、李一鸣、龚明明、刘同亮、潘世瑞和Sarah Erfani在对抗鲁棒性、高效架构设计和图信号处理方面提供了专业意见,并审阅了本节内容。

大型语言模型安全 王一旭、丁一凡、李一歌、李浩楠、韩旭东和郑翔涵盖了对齐、越狱攻击、提示注入和信息提取威胁,并撰写了本节的初稿。邱希鹏、Tim Baldwin、张翔宇、龚宁和刘洋在多语言缩放、泛化理论、隐私保护和对齐方面提供了建议,并对文稿进行了润色。

视觉-语言预训练模型安全 王欣和张佳明回顾了大规模语料库、预训练目标以及迁移评估的相关文献,并完成了本节的初始草案。张天威、顾金东和陈思恒在安全部署、领域泛化和表示学习方面提供了指导,并进一步完善了本节内容。

视觉-语言模型安全 王若凡和吴祖轩回顾了跨模态架构、数据集以及开放性挑战,并撰写了本节的初始草稿。陶大成、马世卿、王聪、张阳和杉山正志在多模态防御与安全对齐方面提供了专业见解,并对基准和部署提出了反馈意见。

扩散模型安全 高一峰设计了本节的结构,并综述了关于对抗攻击、越狱、后门以及知识产权保护的文献。许恒源、赵云涵、陈云浩调研了成员推理和数据/模型提取攻击的研究。肖超伟、吴宝元、庞天宇、董寅鹏、谢赐航在生成式模型鲁棒性方面提供了技术指导,并对本节进行了批判性修订。

智能体安全 吴宇涛设计了本节的结构并撰写了初稿。李博、张阳、刘、贾若曦、王聪、刘洋、陈思恒和肖超威对间接提示注入攻击与防御、安全工具使用等方面提供了见解,并协助完善了本节的结构。

参考文献

  1. Y. Fu, S. Zhang, S. Wu, C. Wan, and Y. Lin, “Patch-fool: Are vision transformers always robust against adversarial perturbations?” in ICLR, 2022.

  2. K. Navaneet, S. A. Koohpayegani, E. Sleiman, and H. Pirsiavash, “Slowformer: Adversarial attack on compute and energy consumption of efficient vision transformers,” in CVPR, 2024.

  3. S. Gao, T. Chen, M. He, R. Xu, H. Zhou, and J. Li, “Pe-attack: On the universal positional embedding vulnerability in transformer-based models,” IEEE Transactions on Information Forensics and Security, vol. 19, pp. 9359–9373, 2024.

  4. G. Lovisotto, N. Finnie, M. Munoz, C. K. Mummadi, and J. H. Metzen, “Give me your attention: Dot-product attention considered harmful for adversarial patch robustness,” in CVPR, 2022.

  5. S. Jain and T. Dutta, “Towards understanding and improving adversarial robustness of vision transformers,” in CVPR, 2024.

  6. M. Naseer, K. Ranasinghe, S. Khan, F. S. Khan, and F. Porikli, “On improving adversarial transferability of vision transformers,” arXiv preprint arXiv:2106.04169, 2021.

  7. Y. Wang, J. Wang, Z. Yin, R. Gong, J. Wang, A. Liu, and X. Liu, “Generating transferable adversarial examples against vision transformers,” in ACM MM, 2022.

  8. Z. Wei, J. Chen, M. Goldblum, Z. Wu, T. Goldstein, and Y.-G. Jiang, “Towards transferable adversarial attacks on vision transformers,” in AAAI, 2022.

  9. X. Wei and S. Zhao, “Boosting adversarial transferability with learnable patch-wise masks,” IEEE Transactions on Multimedia, vol. 26, pp. 3778–3787, 2023.

  10. W. Ma, Y. Li, X. Jia, and W. Xu, “Transferable adversarial attack for both vision transformers and convolutional networks via momentum integrated gradients,” in ICCV, 2023.

  11. J. Zhang, Y. Huang, W. Wu, and M. R. Lyu, “Transferable adversarial attacks on vision transformers with token gradient regularization,” in CVPR, 2023.

  12. J. Zhang, Y. Huang, Z. Xu, W. Wu, and M. R. Lyu, “Improving the adversarial transferability of vision transformers with virtual dense connection,” in AAAI, 2024.

  13. C. Gao, H. Zhou, J. Yu, Y. Ye, J. Cai, J. Wang, and W. Yang, “Attacking transformers with feature diversity adversarial perturbation,” in AAAI, 2024.

  14. Y. Shi, Y. Han, Y.-a. Tan, and X. Kuang, “Decision-based black-box attack against vision transformers via patch-wise adversarial removal,” NeurIPS, 2022.

  15. H. Wu, G. Ou, W. Wu, and Z. Zheng, “Improving transferable targeted adversarial attacks with model self-enhancement,” in CVPR, 2024.

  16. Z. Li, M. Ren, F. Jiang, Q. Li, and Z. Sun, “Improving transferability of adversarial samples via critical region-oriented feature-level attack,” IEEE Transactions on Information Forensics and Security, vol. 19, p. 6650–6664, 2024.

  17. A. Joshi, G. Jagatap, and C. Hegde, “Adversarial token attacks on vision transformers,” arXiv preprint arXiv:2110.04337, 2021.

  18. Z. Chen, C. Xu, H. Lv, S. Liu, and Y. Ji, “Understanding and improving adversarial transferability of vision transformers and convolutional neural networks,” Information Sciences, vol. 648, p. 119474, 2023.

  19. Z. Wei, J. Chen, M. Goldblum, Z. Wu, T. Goldstein, Y.-G. Jiang, and L. S. Davis, “Towards transferable adversarial attacks on image and video transformers,” IEEE Transactions on Image Processing, vol. 32, pp. 6346–6358, 2023.

  20. B. Wu, J. Gu, Z. Li, D. Cai, X. He, and W. Liu, “Towards efficient adversarial training on vision transformers,” in ECCV, 2022.

  21. J. Li, “Patch vestiges in the adversarial examples against vision transformer can be leveraged for adversarial detection,” in AAAI Workshop, 2022.

  22. S. Sun, K. Nwodo, S. Sugrim, A. Stavrou, and H. Wang, “Vitguard: Attention-aware detection against adversarial examples for vision transformer,” arXiv preprint arXiv:2409.13828, 2024.

  23. L. Liu, Y. Guo, Y. Zhang, and J. Yang, “Understanding and defending patched-based adversarial attacks for vision transformer,” in ICML, 2023.

  24. M. Bai, W. Huang, T. Li, A. Wang, J. Gao, C. F. Caiafa, and Q. Zhao, “Diffusion models demand contrastive guidance for adversarial purification to advance,” in ICML, 2024.

  25. X. Li, W. Sun, H. Chen, Q. Li, Y. Liu, Y. He, J. Shi, and X. Hu, “Adbm: Adversarial diffusion bridge model for reliable adversarial purification,” arXiv preprint arXiv:2408.00315, 2024.

  26. C. T. Lei, H. M. Yam, Z. Guo, and C. P. Lau, “Instant adversarial purification with adversarial consistency distillation,” arXiv preprint arXiv:2408.17064, 2024.

  27. J. Gu, V. Tresp, and Y. Qin, “Are vision transformers robust to patch perturbations?” in ECCV, 2022.

  28. Y. Mo, D. Wu, Y. Wang, Y. Guo, and Y. Wang, “When adversarial training meets vision transformers: Recipes from training to architecture,” NeurIPS, 2022.

  29. Y. Guo, D. Stutz, and B. Schiele, “Robustifying token attention for vision transformers,” in ICCV, 2023.

  30. Y. Y. Guo, D. L. Stutz, and B. T. Schiele, “Improving robustness of vision transformers by reducing sensitivity to patch corruptions,” in CVPR, 2023.

  31. L. Hu, Y. Liu, N. Liu, M. Huai, L. Sun, and D. Wang, “Improving interpretation faithfulness for vision transformers,” in Proc. Int. Conf. Mach. Learn., 2024.

  32. H. Gong, M. Dong, S. Ma, S. Camtepe, S. Nepal, and C. Xu, “Random entangled tokens for adversarially robust vision transformer,” in CVPR, 2024.

  33. W. Nie, B. Guo, Y. Huang, C. Xiao, A. Vahdat, and A. Anandkumar, “Diffusion models for adversarial purification,” in ICML, 2022.

  34. B. Zhang, W. Luo, and Z. Zhang, “Purify++: Improving diffusion-purification with advanced diffusion models and control of randomness,” arXiv preprint arXiv:2310.18762, 2023.

  35. Y. Chen, X. Li, X. Wang, P. Hu, and D. Peng, “Diffilter: Defending against adversarial perturbations with diffusion filter,” IEEE Transactions on Information Forensics and Security, vol. 19, pp. 6779–6794, 2024.

  36. K. Song, H. Lai, Y. Pan, and J. Yin, “Mimicdiffusion: Purifying adversarial perturbation via mimicking clean diffusion model,” in CVPR, 2024.

  37. H. Khalili, S. Park, V. Li, B. Bright, A. Payani, R. R. Kompella, and N. Sehatbakhsh, “Lightpure: Realtime adversarial image purification for mobile devices using diffusion models,” in ACM MobiCom, 2024.

  38. G. Zollicoffer, M. Vu, B. Nebgen, J. Castorena, B. Alexandrov, and M. Bhattarai, “Lorid: Low-rank iterative diffusion for adversarial purification,” arXiv preprint arXiv:2409.08255, 2024.

  39. Z. Yuan, P. Zhou, K. Zou, and Y. Cheng, “You are catching my attention: Are vision transformers bad learners under backdoor attacks?” in CVPR, 2023.

  40. M. Zheng, Q. Lou, and L. Jiang, “Trojvit: Trojan insertion in vision transformers,” in CVPR, 2023.

  41. S. Yang, J. Bai, K. Gao, Y. Yang, Y. Li, and S.-T. Xia, “Not all prompts are secure: A switchable backdoor attack against pre-trained vision transfomers,” in CVPR, 2024.

  42. P. Lv, H. Ma, J. Zhou, R. Liang, K. Chen, S. Zhang, and Y. Yang, “Dbia: Data-free backdoor attack against transformer networks,” in ICME, 2023.

  43. Y. Li, X. Ma, J. He, H. Huang, and Y.-G. Jiang, “Multi-trigger backdoor attacks: More triggers, more threats,” arXiv preprint arXiv:2401.15295, 2024.

  44. K. D. Doan, Y. Lao, P. Yang, and P. Li, “Defending backdoor attacks on vision transformer via patch processing,” in AAAI, 2023.

  45. A. Subramanya, S. A. Koohpayegani, A. Saha, A. Tejankar, and H. Pirsiavash, “A closer look at robustness of vision transformers to backdoor attacks,” in WACV, 2024.

  46. A. Subramanya, A. Saha, S. A. Koohpayegani, A. Tejankar, and H. Pirsiavash, “Backdoor attacks on vision transformers,” arXiv preprint arXiv:2206.08477, 2022.

  47. Y. Shen, Z. Li, and G. Wang, “Practical region-level attack against segment anything models,” in CVPR, 2024.

  48. F. Croce and M. Hein, “Segment (almost) nothing: Prompt-agnostic adversarial attacks on segmentation models,” in SaTML, 2024.

  49. C. Zhang, C. Zhang, T. Kang, D. Kim, S.-H. Bae, and I. S. Kweon, “Attack-sam: Towards evaluating adversarial robustness of segment anything model,” arXiv preprint arXiv:2305.00866, 2023.

  50. S. Zheng and C. Zhang, “Black-box targeted adversarial attack on segment anything (sam),” arXiv preprint arXiv:2310.10010, 2023.

  51. J. Lu, X. Yang, and X. Wang, “Unsegment anything by simulating deformation,” in CVPR, 2024.

  52. S. Xia, W. Yang, Y. Yu, X. Lin, H. Ding, L. Duan, and X. Jiang, “Transferable adversarial attacks on sam and its downstream models,” in NeurIPS, 2024.

  53. D. Han, S. Zheng, and C. Zhang, “Segment anything meets universal adversarial perturbation,” arXiv preprint arXiv:2310.12431, 2023.

  54. Z. Zhou, Y. Song, M. Li, S. Hu, X. Wang, L. Y. Zhang, D. Yao, and H. Jin, “Darksam: Fooling segment anything model to segment nothing,” in NeurIPS, 2024.

  55. B. Li, H. Xiao, and L. Tang, “Asam: Boosting segment anything model with adversarial tuning,” in CVPR, 2024.

  56. Z. Guan, M. Hu, Z. Zhou, J. Zhang, S. Li, and N. Liu, “Badsam: Exploring security vulnerabilities of sam via backdoor attacks (student abstract),” in AAAI, 2024.

  57. Y. Sun, H. Zhang, T. Zhang, X. Ma, and Y.-G. Jiang, “Unseg: One universal unlearnable example generator is enough against all image segmentation,” in NeurIPS, 2024.

  58. N. Boucher, I. Shumailov, R. Anderson, and N. Papernot, “Bad characters: Imperceptible nlp attacks,” in IEEE S&P, 2022.

  59. D. Jin, Z. Jin, J. T. Zhou, and P. Szolovits, “Is bert really robust? a strong baseline for natural language attack on text classification and entailment,” in AAAI, 2020.

  60. L. Li, R. Ma, Q. Guo, X. Xue, and X. Qiu, “Bert-attack: Adversarial attack against bert using bert,” in EMNLP, 2020.

  61. C. Guo, A. Sablayrolles, H. Jégou, and D. Kiela, “Gradient-based adversarial attacks against text transformers,” in EMNLP, 2021.

  62. A. Dirkson, S. Verberne, and W. Kraaij, “Breaking bert: Understanding its vulnerabilities for named entity recognition through adversarial attack,” arXiv preprint arXiv:2109.11308, 2021.

  63. Y. Wang, P. Shi, and H. Zhang, “Gradient-based word substitution for obstinate adversarial examples generation in language models,” arXiv preprint arXiv:2307.12507, 2023.

  64. H. Liu, C. Cai, and Y. Qi, “Expanding scope: Adapting english adversarial attacks to chinese,” in TrustNLP, 2023.

  65. J. Wang, Z. Liu, K. H. Park, Z. Jiang, Z. Zheng, Z. Wu, M. Chen, and C. Xiao, “Adversarial demonstration attacks on large language models,” arXiv preprint arXiv:2305.14950, 2023.

  66. B. Liu, B. Xiao, X. Jiang, S. Cen, X. He, and W. Dou, “Adversarial attacks on large language model-based system and mitigating strategies: A case study on chatgpt,” Security and Communication Networks, vol. 2023, p. 10, 2023.

  67. A. Koleva, M. Ringsquandl, and V. Tresp, “Adversarial attacks on tables with entity swap,” arXiv preprint arXiv:2309.08650, 2023.

  68. N. Jain, A. Schwarzschild, Y. Wen, G. Somepalli, J. Kirchenbauer, P.-y. Chiang, M. Goldblum, A. Saha, J. Geiping, and T. Goldstein, “Baseline defenses for adversarial attacks against aligned language models,” arXiv preprint arXiv:2309.00614, 2023.

  69. A. Kumar, C. Agarwal, S. Srinivas, S. Feizi, and H. Lakkaraju, “Certifying llm safety against adversarial prompting,” arXiv preprint arXiv:2309.02705, 2023.

  70. A. Zou, L. Phan, J. Wang, D. Duenas, M. Lin, M. Andriushchenko, J. Z. Kolter, M. Fredrikson, and D. Hendrycks, “Improving alignment and robustness with circuit breakers,” in NeurIPS, 2024.

  71. Z.-X. Yong, C. Menghini, and S. H. Bach, “Low-resource languages jailbreak gpt-4,” in NeurIPS Workshop, 2023.

  72. Y. Yuan, W. Jiao, W. Wang, J.-t. Huang, P. He, S. Shi, and Z. Tu, “Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher,” arXiv preprint arXiv:2308.06463, 2023.

  73. A. Wei, N. Haghtalab, and J. Steinhardt, “Jailbroken: How does llm safety training fail?” NeurIPS, 2024.

  74. J. Li, Y. Liu, C. Liu, L. Shi, X. Ren, Y. Zheng, Y. Liu, and Y. Xue, “A cross-language investigation into jailbreak attacks in large language models,” arXiv preprint arXiv:2401.16765, 2024.

  75. W. Zhou, X. Wang, L. Xiong, H. Xia, Y. Gu, M. Chai, F. Zhu, C. Huang, S. Dou, Z. Xi et al., “Easyjailbreak: A unified framework for jailbreaking large language models,” arXiv preprint arXiv:2403.12171, 2024.

  76. X. Zou, Y. Chen, and K. Li, “Is the system message really important to jailbreaks in large language models?” arXiv preprint arXiv:2402.14857, 2024.

  77. Z. Xiao, Y. Yang, G. Chen, and Y. Chen, “Tastle: Distract large language models for automatic jailbreak attack,” in EMNLP, 2024.

  78. B. Li, H. Xing, C. Huang, J. Qian, H. Xiao, L. Feng, and C. Tian, “Structuralsleight: Automated jailbreak attacks on large language models utilizing uncommon text-encoded structure,” arXiv preprint arXiv:2406.08754, 2024.

  79. H. Lv, X. Wang, Y. Zhang, C. Huang, S. Dou, J. Ye, T. Gui, Q. Zhang, and X. Huang, “Codechameleon: Personalized encryption framework for jailbreaking large language models,” arXiv preprint arXiv:2402.16717, 2024.

  80. Z. Chang, M. Li, Y. Liu, J. Wang, Q. Wang, and Y. Liu, “Play guessing game with llm: Indirect jailbreak attack with implicit clues,” in ACL, 2024.

  81. Y. Wen, K. Bi, W. Chen, J. Guo, and X. Cheng, “Evaluating implicit bias in large language models by attacking from a psychometric perspective,” in Findings of ACL, 2025.

  82. S. Lin, R. Li, X. Wang, C. Lin, W. Xing, and M. Han, “Llms can be dangerous reasoners: Analyzing-based jailbreak attack on large language models,” arXiv preprint arXiv:2407.16205, 2024.

  83. X. Liu, N. Xu, M. Chen, and C. Xiao, “AutoDAN: Generating stealthy jailbreak prompts on aligned large language models,” in ICLR, 2024.

  84. J. Yu, X. Lin, Z. Yu, and X. Xing, “Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts,” arXiv preprint arXiv:2309.10253, 2023.

  85. P. Chao, A. Robey, E. Dobriban, H. Hassani, G. J. Pappas, and E. Wong, “Jailbreaking black box large language models in twenty queries,” in NeurIPS Workshop, 2023.

  86. G. Deng, Y. Liu, Y. Li, K. Wang, Y. Zhang, Z. Li, H. Wang, T. Zhang, and Y. Liu, “Masterkey: Automated jailbreaking of large language model chatbots,” in NDSS, 2024.

  87. J. Yu, H. Luo, J. Yao-Chieh, W. Guo, H. Liu, and X. Xing, “Enhancing jailbreak attack against large language models through silent tokens,” arXiv preprint arXiv:2405.20653, 2024.

  88. D. Yao, J. Zhang, I. G. Harris, and M. Carlsson, “Fuzzllm: A novel and universal fuzzing framework for proactively discovering jailbreak vulnerabilities in large language models,” in ICASSP, 2024.

  89. J. Zhang, Z. Wang, R. Wang, X. Ma, and Y.-G. Jiang, “Enja: Ensemble jailbreak on large language models,” arXiv preprint arXiv:2408.03603, 2024.

  90. E. Perez, S. Huang, F. Song, T. Cai, R. Ring, J. Aslanides, A. Glaese, N. McAleese, and G. Irving, “Red teaming language models with language models,” in EMNLP, 2022.

  91. Z.-W. Hong, I. Shenfeld, T.-H. Wang, Y.-S. Chuang, A. Pareja, J. Glass, A. Srivastava, and P. Agrawal, “Curiosity-driven red-teaming for large language models,” in ICLR, 2024.

  92. X. Shen, Z. Chen, M. Backes, Y. Shen, and Y. Zhang, ““do anything now”: Characterizing and evaluating in-the-wild jailbreak prompts on large language models,” in ACM CCS, 2024.

  93. A. Zou, Z. Wang, N. Carlini, M. Nasr, J. Z. Kolter, and M. Fredrikson, “Universal and transferable adversarial attacks on aligned language models,” arXiv preprint arXiv:2307.15043, 2023.

  94. X. Jia, T. Pang, C. Du, Y. Huang, J. Gu, Y. Liu, X. Cao, and M. Lin, “Improved techniques for optimization-based jailbreaking on large language models,” arXiv preprint arXiv:2405.21018, 2024.

  95. Y. Huang, C. Wang, X. Jia, Q. Guo, F. Juefei-Xu, J. Zhang, G. Pu, and Y. Liu, “Semantic-guided prompt organization for universal goal hijacking against llms,” in ACL, 2025.

  96. X. Zheng, T. Pang, C. Du, Q. Liu, J. Jiang, and M. Lin, “Improved few-shot jailbreaking can circumvent aligned language models and their defenses,” in arXiv preprint arXiv:2406.01288, 2024.

  97. X. Zhao, X. Yang, T. Pang, C. Du, L. Li, Y.-X. Wang, and W. Y. Wang, “Weak-to-strong jailbreaking on large language models,” arXiv preprint arXiv:2401.17256, 2024.

  98. W. Jiang, Z. Wang, J. Zhai, S. Ma, Z. Zhao, and C. Shen, “Unlocking adversarial suffix optimization without affirmative phrases: Efficient black-box jailbreaking via llm as optimizer,” arXiv preprint arXiv:2408.11313, 2024.

  99. X. Qi, Y. Zeng, T. Xie, P.-Y. Chen, R. Jia, P. Mittal, and P. Henderson, “Fine-tuning aligned language models compromises safety, even when users do not intend to!” arXiv preprint arXiv:2310.03693, 2023.

  100. T. Huang, S. Hu, F. Ilhan, S. F. Tekin, and L. Liu, “Virus: Harmful fine-tuning attack for large language models bypassing guardrail moderation,” arXiv preprint arXiv:2501.17433, 2025.

  101. A. Robey, E. Wong, H. Hassani, and G. J. Pappas, “Smoothllm: Defending large language models against jailbreaking attacks,” arXiv preprint arXiv:2310.03684, 2023.

  102. J. Ji, B. Hou, A. Robey, G. J. Pappas, H. Hassani, Y. Zhang, E. Wong, and S. Chang, “Defending large language models against jailbreak attacks via semantic smoothing,” arXiv preprint arXiv:2402.16192, 2024.

  103. X. Wang, D. Wu, Z. Ji, Z. Li, P. Ma, S. Wang, Y. Li, Y. Liu, N. Liu, and J. Rahmel, “Selfdefend: Llms can defend themselves against jailbreaking in a practical manner,” arXiv preprint arXiv:2406.05498, 2024.

  104. Z. Liu, Z. Wang, L. Xu, J. Wang, L. Song, T. Wang, C. Chen, W. Cheng, and J. Bian, “Protecting your llms with information bottleneck,” in NeurIPS, 2024.

  105. C. Liang, L. Shen, Y. Deng, X. Zhao, B. Liang, and K.-F. Wong, “Pearl: Towards permutation-resilient llms,” in ICLR, 2025.

  106. C. Liang, X. Han, L. Shen, J. Bai, and K.-F. Wong, “Vulnerability-aware alignment: Mitigating uneven forgetting in harmful fine-tuning,” in ICML, 2025.

  107. Y. Wang, Z. Shi, A. Bai, and C.-J. Hsieh, “Defending llms against jailbreaking attacks via backtranslation,” in ACL, 2024.

  108. C. Yung, H. M. Dolatabadi, S. Erfani, and C. Leckie, “Round trip translation defence against large language model jailbreaking attacks,” in PAKDD, 2025.

  109. C. Yung, H. Huang, S. M. Erfani, and C. Leckie, “Curvalid: Geometrically-guided adversarial prompt detection,” arXiv preprint arXiv:2503.03502, 2025.

  110. J. Kim, A. Derakhshan, and I. G. Harris, “Robust safety classifier against jailbreaking attacks: Adversarial prompt shield,” in WOAH, 2024.

  111. C. Xiong, X. Qi, P.-Y. Chen, and T.-Y. Ho, “Defensive prompt patch: A robust and interpretable defense of llms against jailbreak attacks,” arXiv preprint arXiv:2405.20099, 2024.

  112. X. Hu, P.-Y. Chen, and T.-Y. Ho, “Gradient cuff: Detecting jailbreak attacks on large language models by exploring refusal loss landscapes,” in NeurIPS, 2024.

  113. L. Gao, J. Geng, X. Zhang, P. Nakov, and X. Chen, “Shaping the safety boundaries: Understanding and defending against jailbreaks in large language models,” in ACL, 2025.

  114. J. Wu, J. Deng, S. Pang, Y. Chen, J. Xu, X. Li, and W. Xu, “Legilimens: Practical and unified content moderation for large language model services,” in ACM CCS, 2024.

  115. B. Chen, A. Paliwal, and Q. Yan, “Jailbreaker in jail: Moving target defense for large language models,” in MTD, 2023.

  116. Z. Zhang, Q. Zhang, and J. Foerster, “Parden, can you repeat that? defending against jailbreaks via repetition,” arXiv preprint arXiv:2405.07932, 2024.

  117. L. Lu, H. Yan, Z. Yuan, J. Shi, W. Wei, P.-Y. Chen, and P. Zhou, “Autojailbreak: Exploring jailbreak attacks and defenses through a dependency lens,” arXiv preprint arXiv:2406.03805, 2024.

  118. Y. Du, S. Zhao, D. Zhao, M. Ma, Y. Chen, L. Huo, Q. Yang, D. Xu, and B. Qin, “MoGU: A framework for enhancing safety of LLMs while preserving their usability,” in NeurIPS, 2024.

  119. T. Huang, S. Hu, and L. Liu, “Vaccine: Perturbation-aware alignment for large language models against harmful fine-tuning attack,” NeurIPS, 2024.

  120. G. Liu, W. Lin, T. Huang, R. Mo, Q. Mu, and L. Shen, “Targeted vaccine: Safety alignment for large language models against harmful fine-tuning via layer-wise perturbation,” arXiv preprint arXiv:2410.09760, 2024.

  121. T. Huang, S. Hu, F. Ilhan, S. F. Tekin, and L. Liu, “Booster: Tackling harmful fine-tuning for large language models via attenuating harmful perturbation,” arXiv preprint arXiv:2409.01586, 2024.

  122. T. Huang, S. Hu, F. Ilhan, S. Tekin, and L. Liu, “Lisa: Lazy safety alignment for large language models against harmful fine-tuning attack,” NeurIPS, 2024.

  123. T. Huang, G. Bhattacharya, P. Joshi, J. Kimball, and L. Liu, “Antidote: Post-fine-tuning safety alignment for large language models against harmful fine-tuning,” arXiv preprint arXiv:2408.09600, 2024.

  124. Y. Wang, T. Huang, L. Shen, H. Yao, H. Luo, R. Liu, N. Tan, J. Huang, and D. Tao, “Panacea: Mitigating harmful fine-tuning for large language models via post-fine-tuning perturbation,” arXiv preprint arXiv:2501.18100, 2025.

  125. F. Perez and I. Ribeiro, “Ignore previous prompt: Attack techniques for language models,” in NeurIPS Workshop, 2022.

  126. Y. Liu, G. Deng, Y. Li, K. Wang, Z. Wang, X. Wang, T. Zhang, Y. Liu, H. Wang, Y. Zheng et al., “Prompt injection attack against llm-integrated applications,” arXiv preprint arXiv:2306.05499, 2023.

  127. K. Greshake, S. Abdelnabi, S. Mishra, C. Endres, T. Holz, and M. Fritz, “Not what you’ve signed up for: Compromising real-world llm-integrated applications with indirect prompt injection,” in AISec, 2023.

  128. B. Deng, W. Wang, F. Feng, Y. Deng, Q. Wang, and X. He, “Attack prompt generation for red teaming and defending large language models,” in EMNLP, 2023.

  129. Y. Liu, Y. Jia, R. Geng, J. Jia, and N. Z. Gong, “Formalizing and benchmarking prompt injection attacks and defenses,” in USENIX Security, 2024, pp. 1831–1847.

  130. R. Ye, X. Pang, J. Chai, J. Chen, Z. Yin, Z. Xiang, X. Dong, J. Shao, and S. Chen, “Are we there yet? revealing the risks of utilizing large language models in scholarly peer review,” arXiv preprint arXiv:2412.01708, 2024.

  131. X. Liu, Z. Yu, Y. Zhang, N. Zhang, and C. Xiao, “Automatic and universal prompt injection attacks against large language models,” arXiv preprint arXiv:2403.04957, 2024.

  132. C. Zhang, M. Jin, Q. Yu, C. Liu, H. Xue, and X. Jin, “Goal-guided generative prompt injection attack on large language models,” arXiv preprint arXiv:2404.07234, 2024.

  133. B. Hui, H. Yuan, N. Gong, P. Burlina, and Y. Cao, “Pleak: Prompt leaking attacks against large language model applications,” in ACM SIGSAC CCS, 2024.

  134. J. Shi, Z. Yuan, Y. Liu, Y. Huang, P. Zhou, L. Sun, and N. Z. Gong, “Optimization-based prompt injection attack to llm-as-a-judge,” in ACM SIGSAC CCS, 2024.

  135. Z. Shao, H. Liu, J. Mu, and N. Z. Gong, “Making llms vulnerable to prompt injection via poisoning alignment,” arXiv preprint arXiv:2410.14827, 2024.

  136. J. Yu, Y. Shao, H. Miao, and J. Shi, “Promptfuzz: Harnessing fuzzing techniques for robust testing of prompt injection in llms,” arXiv preprint arXiv:2409.14729, 2024.

  137. S. Chen, J. Piet, C. Sitawarin, and D. Wagner, “Struq: Defending against prompt injection with structured queries,” USENIX Security, 2025.

  138. R. K. Sharma, V. Gupta, and D. Grossman, “Spml: A dsl for defending language models against prompt attacks,” arXiv preprint arXiv:2402.11755, 2024.

  139. J. Piet, M. Alrashed, C. Sitawarin, S. Chen, Z. Wei, E. Sun, B. Alomair, and D. Wagner, “Jatmo: Prompt injection defense by task-specific finetuning,” arXiv preprint arXiv:2312.17673, 2023.

  140. J. Yi, Y. Xie, B. Zhu, E. Kiciman, G. Sun, X. Xie, and F. Wu, “Benchmarking and defending against indirect prompt injection attacks on large language models,” arXiv preprint arXiv:2312.14197, 2023.

  141. S. Chen, A. Zharmagambetov, S. Mahloujifar, K. Chaudhuri, D. Wagner, and C. Guo, “Secalign: Defending against prompt injection with preference optimization,” arXiv preprint arXiv:2410.05451v2, 2025.

  142. X. Cai, H. Xu, S. Xu, Y. Zhang et al., “Badprompt: Backdoor attacks on continuous prompts,” NeurIPS, 2022.

  143. J. Yan, V. Gupta, and X. Ren, “Bite: Textual backdoor attacks with iterative trigger injection,” in ACL, 2023.

  144. H. Yao, J. Lou, and Z. Qin, “Poisonprompt: Backdoor attack on prompt-based large language models,” in ICASSP, 2024.

  145. S. Zhao, J. Wen, L. A. Tuan, J. Zhao, and J. Fu, “Prompt as triggers for backdoor attack: Examining the vulnerability in language models,” in EMNLP, 2023.

  146. J. Xu, M. D. Ma, F. Wang, C. Xiao, and M. Chen, “Instructions as backdoors: Backdoor vulnerabilities of instruction tuning for large language models,” in NAACL, 2024.

  147. R. Zhang, H. Li, R. Wen, W. Jiang, Y. Zhang, M. Backes, Y. Shen, and Y. Zhang, “Instruction backdoor attacks against customized LLMs,” in USENIX Security, 2024.

  148. N. Kandpal, M. Jagielski, F. Tramèr, and N. Carlini, “Backdoor attacks for in-context learning with language models,” in ICML Workshop, 2023.

  149. Z. Xiang, F. Jiang, Z. Xiong, B. Ramasubramanian, R. Poovendran, and B. Li, “Badchain: Backdoor chain-of-thought prompting for large language models,” in NeurIPS Workshop, 2024.

  150. S. Zhao, M. Jia, L. A. Tuan, F. Pan, and J. Wen, “Universal vulnerabilities in large language models: Backdoor attacks for in-context learning,” in EMNLP, 2024.

  151. Y. Qiang, X. Zhou, S. Z. Zade, M. A. Roshani, D. Zytko, and D. Zhu, “Learning to poison large language models during instruction tuning,” arXiv preprint arXiv:2402.13459, 2024.

  152. P. Pathmanathan, S. Chakraborty, X. Liu, Y. Liang, and F. Huang, “Is poisoning a real threat to llm alignment? maybe more so than you think,” in ICML Workshop, 2024.

  153. E. Hubinger, C. Denison, J. Mu, M. Lambert, M. Tong, M. MacDiarmid, T. Lanham, D. M. Ziegler, T. Maxwell, N. Cheng et al., “Sleeper agents: Training deceptive llms that persist through safety training,” arXiv preprint arXiv:2401.05566, 2024.

  154. P. He, H. Xu, Y. Xing, H. Liu, M. Yamada, and J. Tang, “Data poisoning for in-context learning,” arXiv preprint arXiv:2402.02160, 2024.

  155. Q. Zhang, B. Zeng, C. Zhou, G. Go, H. Shi, and Y. Jiang, “Human-imperceptible retrieval poisoning attacks in llm-powered applications,” arXiv preprint arXiv:2404.17196, 2024.

  156. S. YAN, S. WANG, Y. DUAN, H. HONG, K. LEE, D. KIM, and Y. HONG, “An llm-assisted easy-to-trigger poisoning attack on code completion models: Injecting disguised vulnerabilities against strong detection,” in USENIX Security, 2024.

  157. H. Huang, Z. Zhao, M. Backes, Y. Shen, and Y. Zhang, “Composite backdoor attacks against large language models,” in NAACL, 2024.

  158. N. Gu, P. Fu, X. Liu, Z. Liu, Z. Lin, and W. Wang, “A gradient control method for backdoor attacks on parameter-efficient tuning,” in ACL, 2023.

  159. J. Xue, M. Zheng, T. Hua, Y. Shen, Y. Liu, L. Bölöni, and Q. Lou, “Trojllm: A black-box trojan prompt attack on large language models,” NeurIPS, 2024.

  160. J. Yan, V. Yadav, S. Li, L. Chen, Z. Tang, H. Wang, V. Srinivasan, X. Ren, and H. Jin, “Backdooring instruction-tuned large language models with virtual prompt injection,” in NAACL, 2024.

  161. Q. Zeng, M. Jin, Q. Yu, Z. Wang, W. Hua, Z. Zhou, G. Sun, Y. Meng, S. Ma, Q. Wang et al., “Uncertainty is fragile: Manipulating uncertainty in large language models,” arXiv preprint arXiv:2407.11282, 2024.

  162. Y. Li, T. Li, K. Chen, J. Zhang, S. Liu, W. Wang, T. Zhang, and Y. Liu, “Badedit: Backdooring large language models by model editing,” in ICLR, 2024.

  163. X. He, J. Wang, B. Rubinstein, and T. Cohn, “Imbert: Making bert immune to insertion-based backdoor attacks,” in TrustNLP, 2023.

  164. J. Li, Z. Wu, W. Ping, C. Xiao, and V. Vydiswaran, “Defending against insertion-based textual backdoor attacks via attribution,” in ACL, 2023.

  165. X. Sun, X. Li, Y. Meng, X. Ao, L. Lyu, J. Li, and T. Zhang, “Defending against backdoor attacks in natural language generation,” in AAAI, 2023.

  166. L. Yan, Z. Zhang, G. Tao, K. Zhang, X. Chen, G. Shen, and X. Zhang, “Parafuzz: An interpretability-driven technique for detecting poisoned samples in nlp,” NeurIPS, 2024.

  167. Z. Xi, T. Du, C. Li, R. Pang, S. Ji, J. Chen, F. Ma, and T. Wang, “Defending pre-trained language models as few-shot learners against backdoor attacks,” NeurIPS, 2024.

  168. B. Yi, T. Huang, S. Chen, T. Li, Z. Liu, Z. Chu, and Y. Li, “Probe before you talk: Towards black-box defense against backdoor unalignment for large language models,” in ICLR, 2025.

  169. M. Lamparth and A. Reuel, “Analyzing and editing inner mechanisms of backdoored language models,” in ACM FAccT, 2024.

  170. H. Li, Y. Chen, Z. Zheng, Q. Hu, C. Chan, H. Liu, and Y. Song, “Backdoor removal for generative large language models,” arXiv preprint arXiv:2405.07667, 2024.

  171. Y. Zeng, W. Sun, T. N. Huynh, D. Song, B. Li, and R. Jia, “Beear: Embedding-based adversarial removal of safety backdoors in instruction-tuned language models,” in EMNLP, 2024.

  172. N. M. Min, L. H. Pham, Y. Li, and J. Sun, “Crow: Eliminating backdoors from large language models via internal consistency regularization,” arXiv preprint arXiv:2411.12768, 2024.

  173. R. R. Tang, J. Yuan, Y. Li, Z. Liu, R. Chen, and X. Hu, “Setting the trap: Capturing and defeating backdoors in pretrained language models through honeypots,” NeurIPS, 2023.

  174. Z. Liu, B. Shen, Z. Lin, F. Wang, and W. Wang, “Maximum entropy loss, the silver bullet targeting backdoor attacks in pre-trained language models,” in ACL, 2023.

  175. Z. Wang, Z. Wang, M. Jin, M. Du, J. Zhai, and S. Ma, “Data-centric nlp backdoor defense from the lens of memorization,” arXiv preprint arXiv:2409.14200, 2024.

  176. T. Tong, J. Xu, Q. Liu, and M. Chen, “Securing multi-turn conversational language models against distributed backdoor triggers,” arXiv preprint arXiv:2407.04151, 2024.

  177. Y. Li, Z. Xu, F. Jiang, L. Niu, D. Sahabandu, B. Ramasubramanian, and R. Poovendran, “Cleangen: Mitigating backdoor attacks for generation tasks in large language models,” in EMNLP, 2024.

  178. T. Li, Q. Liu, T. Pang, C. Du, Q. Guo, Y. Liu, and M. Lin, “Purifying large language models by ensembling a small language model,” arXiv preprint arXiv:2402.14845, 2024.

  179. P. F. Christiano, J. Leike, T. Brown, M. Martic, S. Legg, and D. Amodei, “Deep reinforcement learning from human preferences,” NeurIPS, 2017.

  180. D. M. Ziegler, N. Stiennon, J. Wu, T. B. Brown, A. Radford, D. Amodei, P. Christiano, and G. Irving, “Fine-tuning language models from human preferences,” arXiv preprint arXiv:1909.08593, 2019.

  181. L. Ouyang, J. Wu, X. Jiang, D. Almeida, C. Wainwright, P. Mishkin, C. Zhang, S. Agarwal, K. Slama, A. Ray et al., “Training language models to follow instructions with human feedback,” NeurIPS, 2022.

  182. J. Dai, X. Pan, R. Sun, J. Ji, X. Xu, M. Liu, Y. Wang, and Y. Yang, “Safe rlhf: Safe reinforcement learning from human feedback,” in ICLR, 2024.

  183. G. An, J. Lee, X. Zuo, N. Kosaka, K.-M. Kim, and H. O. Song, “Direct preference-based policy optimization without reward modeling,” NeurIPS, 2023.

  184. R. Rafailov, A. Sharma, E. Mitchell, C. D. Manning, S. Ermon, and C. Finn, “Direct preference optimization: Your language model is secretly a reward model,” NeurIPS, 2024.

  185. Z. Zhou, J. Liu, C. Yang, J. Shao, Y. Liu, X. Yue, W. Ouyang, and Y. Qiao, “Beyond one-preference-for-all: Multi-objective direct preference optimization,” in ACL, 2024.

  186. K. Ethayarajh, W. Xu, N. Muennighoff, D. Jurafsky, and D. Kiela, “Kto: Model alignment as prospect theoretic optimization,” arXiv preprint arXiv:2402.01306, 2024.

  187. C. Zhou, P. Liu, P. Xu, S. Iyer, J. Sun, Y. Mao, X. Ma, A. Efrat, P. Yu, L. Yu et al., “Lima: Less is more for alignment,” NeurIPS, 2024.

  188. Y. Bai, S. Kadavath, S. Kundu, A. Askell, J. Kernion, A. Jones, A. Chen, A. Goldie, A. Mirhoseini, C. McKinnon et al., “Constitutional ai: Harmlessness from ai feedback,” arXiv preprint arXiv:2212.08073, 2022.

  189. Z. Sun, Y. Shen, Q. Zhou, H. Zhang, Z. Chen, D. Cox, Y. Yang, and C. Gan, “Principle-driven self-alignment of language models from scratch with minimal human supervision,” NeurIPS, 2024.

  190. K. Yang, D. Klein, A. Celikyilmaz, N. Peng, and Y. Tian, “RLCD: Reinforcement learning from contrastive distillation for LM alignment,” in ICLR, 2024.

  191. R. Liu, R. Yang, C. Jia, G. Zhang, D. Zhou, A. M. Dai, D. Yang, and S. Vosoughi, “Training socially aligned language models on simulated social interactions,” in ICLR, 2024.

  192. X. Pang, S. Tang, R. Ye, Y. Xiong, B. Zhang, Y. Wang, and S. Chen, “Self-alignment of large language models via monopolylogue-based social scene simulation,” arXiv preprint arXiv:2402.05699, 2024.

  193. Y. Wang, Y. Teng, K. Huang, C. Lyu, S. Zhang, W. Zhang, X. Ma, Y.-G. Jiang, Y. Qiao, and Y. Wang, “Fake alignment: Are llms really aligned well?” in NAACL, 2024.

  194. R. Greenblatt, C. Denison, B. Wright, F. Roger, M. MacDiarmid, S. Marks, J. Treutlein, T. Belonax, J. Chen, D. Duvenaud et al., “Alignment faking in large language models,” arXiv preprint arXiv:2412.14093, 2024.

  195. A. Sheshadri, J. Hughes, J. Michael, A. Mallen, A. Jose, F. Roger et al., “Why do some language models fake alignment while others don’t?” arXiv preprint arXiv:2506.18032, 2025.

  196. S. Chen, C. Liu, M. Haque, Z. Song, and W. Yang, “Nmtsloth: understanding and testing efficiency degradation of neural machine translation systems,” in ESEC/FSE, 2022.

  197. J. Dong, Z. Zhang, Q. Zhang, T. Zhang, H. Wang, H. Li, Q. Li, C. Zhang, K. Xu, and H. Qiu, “An engorgio prompt makes large language model babble on,” in ICLR, 2025.

  198. Y. Chen, S. Chen, Z. Li, W. Yang, C. Liu, R. Tan, and H. Li, “Dynamic transformers provide a false sense of efficiency,” in ACL, 2023.

  199. X. Feng, X. Han, S. Chen, and W. Yang, “Llmeffichecker: Understanding and testing efficiency degradation of large language models,” ACM Transactions on Software Engineering and Methodology, vol. 33, p. 38, 2024.

  200. X. Gao, Y. Chen, X. Yue, Y. Tsao, and N. F. Chen, “Ttslow: Slow down text-to-speech with efficiency robustness evaluations,” arXiv preprint arXiv:2407.01927, 2024.

  201. S. Zhang, M. Zhang, X. Pan, and M. Yang, “No-skim: Towards efficiency robustness evaluation on skimming-based language models,” arXiv preprint arXiv:2312.09494, 2023.

  202. K. Gao, T. Pang, C. Du, Y. Yang, S.-T. Xia, and M. Lin, “Denial-of-service poisoning attacks against large language models,” arXiv preprint arXiv:2410.10760, 2024.

  203. Y. Jiang, C. Chan, M. Chen, and W. Wang, “Lion: Adversarial distillation of proprietary large language models,” in EMNLP, 2023.

  204. Z. Li, C. Wang, P. Ma, C. Liu, S. Wang, D. Wu, C. Gao, and Y. Liu, “On extracting specialized code abilities from large language models: A feasibility study,” in ICSE, 2024.

  205. Z. Liang, Q. Ye, Y. Wang, S. Zhang, Y. Xiao, R. Li, J. Xu, and H. Hu, “Alignment-aware model extraction attacks on large language models,” arXiv preprint arXiv:2409.02718, 2024.

  206. N. Carlini, C. Liu, Ú. Erlingsson, J. Kos, and D. Song, “The secret sharer: Evaluating and testing unintended memorization in neural networks,” in USENIX Security, 2019.

  207. N. Carlini, F. Tramer, E. Wallace, M. Jagielski, A. Herbert-Voss, K. Lee, A. Roberts, T. Brown, D. Song, U. Erlingsson et al., “Extracting training data from large language models,” in USENIX Security, 2021.

  208. M. Nasr, N. Carlini, J. Hayase, M. Jagielski, A. F. Cooper, D. Ippolito, C. A. Choquette-Choo, E. Wallace, F. Tramèr, and K. Lee, “Scalable extraction of training data from (production) language models,” arXiv preprint arXiv:2311.17035, 2023.

  209. Z. Xu, F. Jiang, L. Niu, Y. Deng, R. Poovendran, Y. Choi, and B. Y. Lin, “Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing,” arXiv preprint arXiv:2406.08464, 2024.

  210. A. Al-Kaswan, M. Izadi, and A. Van Deursen, “Traces of memorisation in large language models for code,” in ICSE, 2024.

  211. Y. Bai, G. Pei, J. Gu, Y. Yang, and X. Ma, “Special characters attack: Toward scalable training data extraction from large language models,” arXiv preprint arXiv:2405.05990, 2024.

  212. A. M. Kassem, O. Mahmoud, N. Mireshghallah, H. Kim, Y. Tsvetkov, Y. Choi, S. Saad, and S. Rana, “Alpaca against vicuna: Using llms to uncover memorization of llms,” arXiv preprint arXiv:2403.04801, 2024.

  213. Z. Qi, H. Zhang, E. Xing, S. Kakade, and H. Lakkaraju, “Follow my instruction and spill the beans: Scalable data extraction from retrieval-augmented generation systems,” arXiv preprint arXiv:2402.17840, 2024.

  214. Y. More, P. Ganesh, and G. Farnadi, “Towards more realistic extraction attacks: An adversarial perspective,” arXiv preprint arXiv:2407.02596, 2024.

  215. Q. Zhang, H. Qiu, D. Wang, Y. Li, T. Zhang, W. Zhu, H. Weng, L. Yan, and C. Zhang, “A benchmark for semantic sensitive information in llms outputs,” in ICLR, 2025.

  216. W. Yu, T. Pang, Q. Liu, C. Du, B. Kang, Y. Huang, M. Lin, and S. Yan, “Bag of tricks for training data extraction from language models,” in ICML, 2023.

  217. S. Duan, M. Khona, A. Iyer, R. Schaeffer, and I. R. Fiete, “Uncovering latent memories: Assessing data leakage and memorization patterns in large language models,” in ICML Workshop, 2024.

  218. J. Zhang, Q. Yi, and J. Sang, “Towards adversarial attack on vision-language pre-training models,” in ACM MM, 2022.

  219. Z. Zhou, S. Hu, M. Li, H. Zhang, Y. Zhang, and H. Jin, “Advclip: Downstream-agnostic adversarial examples in multimodal contrastive learning,” in ACM MM, 2023.

  220. D. A. Noever and S. E. M. Noever, “Reading isn’t believing: Adversarial attacks on multi-modal neurons,” arXiv preprint arXiv:2103.10480, 2021.

  221. X. Wang, Z. Zhao, and M. Larson, “Typographic attacks in a multi-image setting,” in NAACL, 2025.

  222. D. Lu, Z. Wang, T. Wang, W. Guan, H. Gao, and F. Zheng, “Set-level guidance attack: Boosting adversarial transferability of vision-language pre-training models,” in ICCV, 2023.

  223. B. He, X. Jia, S. Liang, T. Lou, Y. Liu, and X. Cao, “Sa-attack: Improving adversarial transferability of vision-language pre-training models via self-augmentation,” arXiv preprint arXiv:2312.04913, 2023.

  224. Y. Wang, W. Hu, Y. Dong, H. Zhang, H. Su, and R. Hong, “Exploring transferability of multimodal adversarial samples for vision-language pre-training models with contrastive learning,” arXiv preprint arXiv:2308.12636, 2023.

  225. H. Wang, K. Dong, Z. Zhu, H. Qin, A. Liu, X. Fang, J. Wang, and X. Liu, “Transferable multimodal attack on vision-language pre-training models,” in IEEE S&P, 2024.

  226. Z. Yin, M. Ye, T. Zhang, T. Du, J. Zhu, H. Liu, J. Chen, T. Wang, and F. Ma, “Vlattack: Multimodal adversarial attacks on vision-language tasks via pre-trained models,” in NeurIPS, 2023.

  227. A. Hu, J. Gu, F. Pinto, K. Kamnitsas, and P. Torr, “As firm as their foundations: Can open-sourced foundation models be used to create adversarial examples for downstream tasks?” arXiv preprint arXiv:2403.12693, 2024.

  228. H. Fang, J. Kong, W. Yu, B. Chen, J. Li, S. Xia, and K. Xu, “One perturbation is enough: On generating universal adversarial perturbations against vision-language pre-training models,” arXiv preprint arXiv:2406.05491, 2024.

  229. P.-F. Zhang, Z. Huang, and G. Bai, “Universal adversarial perturbations for vision-language pre-trained models,” in SIGIR, 2024.

  230. H. Huang, S. Erfani, Y. Li, X. Ma, and J. Bailey, “X-transfer attacks: Towards super transferable adversarial attacks on clip,” in ICML, 2025.

  231. S. Gao, X. Jia, X. Ren, I. Tsang, and Q. Guo, “Boosting transferability in vision-language attacks via diversification along the intersection region of adversarial trajectory,” in ECCV, 2024.

  232. D. Han, X. Jia, Y. Bai, J. Gu, Y. Liu, and X. Cao, “Ot-attack: Enhancing adversarial transferability of vision-language models via optimal transport optimization,” arXiv preprint arXiv:2312.04403, 2023.

  233. H. Azuma and Y. Matsui, “Defense-prefix for preventing typographic attacks on clip,” in ICCV, 2023.

  234. J. Zhang, X. Ma, X. Wang, L. Qiu, J. Wang, Y.-G. Jiang, and J. Sang, “Adversarial prompt tuning for vision-language models,” in ECCV, 2024.

  235. L. Li, H. Guan, J. Qiu, and M. Spratling, “One prompt word is enough to boost adversarial robustness for pre-trained vision-language models,” in CVPR, 2024.

  236. H. Fan, Z. Ma, Y. Li, R. Tian, Y. Chen, and C. Gao, “Mixprompt: Enhancing generalizability and adversarial robustness for vision-language models via prompt fusion,” in ICIC, 2024.

  237. N. Hussein, F. Shamshad, M. Naseer, and K. Nandakumar, “Promptsmooth: Certifying robustness of medical vision-language models via prompt learning,” in MICCAI, 2024.

  238. Y. Zhou, X. Xia, Z. Lin, B. Han, and T. Liu, “Few-shot adversarial prompt learning on vision-language models,” in NeurIPS, 2024.

  239. L. Luo, X. Wang, B. Zi, S. Zhao, and X. Ma, “Adversarial prompt distillation for vision-language models,” arXiv preprint arXiv:2411.15244, 2024.

  240. X. Wang, K. Chen, J. Zhang, J. Chen, and X. Ma, “Tapt: Test-time adversarial prompt tuning for robust inference in vision-language models,” in CVPR, 2025.

  241. C. Mao, S. Geng, J. Yang, X. Wang, and C. Vondrick, “Understanding zero-shot adversarial robustness for large-scale models,” in ICLR, 2023.

  242. S. Wang, J. Zhang, Z. Yuan, and S. Shan, “Pre-trained model guided fine-tuning for zero-shot adversarial robustness,” in CVPR, 2024.

  243. W. Zhou, S. Bai, Q. Zhao, and B. Chen, “Revisiting the adversarial robustness of vision language models: a multimodal perspective,” arXiv preprint arXiv:2404.19287, 2024.

  244. C. Schlarmann, N. D. Singh, F. Croce, and M. Hein, “Robust CLIP: Unsupervised adversarial fine-tuning of vision embeddings for robust large vision-language models,” in ICML, 2024.

  245. Z. Wang, X. Li, H. Zhu, and C. Xie, “Revisiting adversarial training at scale,” in CVPR, 2024.

  246. Z. Gan, Y.-C. Chen, L. Li, C. Zhu, Y. Cheng, and J. Liu, “Large-scale adversarial training for vision-and-language representation learning,” in NeurIPS, 2020.

  247. S. Fares, K. Ziu, T. Aremu, N. Durasov, M. Takáč, P. Fua, K. Nandakumar, and I. Laptev, “Mirrorcheck: Efficient adversarial defense for vision-language models,” arXiv preprint arXiv:2406.09250, 2024.

  248. X. Wang, K. Chen, X. Ma, Z. Chen, J. Chen, and Y.-G. Jiang, “AdvQDet: Detecting query-based adversarial attacks with adversarial contrastive prompt tuning,” in ACM MM, 2024.

  249. J. Jia, Y. Liu, and N. Z. Gong, “Badencoder: Backdoor attacks to pre-trained encoders in self-supervised learning,” in IEEE S&P, 2022.

  250. J. Zhang, H. Liu, J. Jia, and N. Z. Gong, “Data poisoning based backdoor attacks to contrastive learning,” in CVPR, 2024.

  251. S. Liang, M. Zhu, A. Liu, B. Wu, X. Cao, and E.-C. Chang, “Badclip: Dual-embedding guided backdoor attack on multimodal contrastive learning,” in CVPR, 2024.

  252. J. Bai, K. Gao, S. Min, S.-T. Xia, Z. Li, and W. Liu, “Badclip: Trigger-aware prompt learning for backdoor attacks on clip,” in CVPR, 2024.

  253. Z. Yang, X. He, Z. Li, M. Backes, M. Humbert, P. Berrang, and Y. Zhang, “Data poisoning attacks against multimodal encoders,” in ICML, 2023.

  254. X. Liu, X. Jia, Y. Xun, S. Liang, and X. Cao, “Multimodal unlearnable examples: Protecting data against multimodal contrastive learning,” in ACMMM, 2024.

  255. N. Carlini and A. Terzis, “Poisoning and backdooring contrastive learning,” in ICLR, 2022.

  256. H. Bansal, N. Singhi, Y. Yang, F. Yin, A. Grover, and K.-W. Chang, “Cleanclip: Mitigating data poisoning attacks in multimodal contrastive learning,” in ICCV, 2023.

  257. W. Yang, J. Gao, and B. Mirzasoleiman, “Better safe than sorry: Pre-training CLIP against targeted data poisoning and backdoor attacks,” in ICML, 2024.

  258. Wenhan Yang, Jingdong Gao, and Baharan Mirzasoleiman, “Robust contrastive language-image pretraining against data poisoning and backdoor attacks,” in NeurIPS, 2024.

  259. S. Feng, G. Tao, S. Cheng, G. Shen, X. Xu, Y. Liu, K. Zhang, S. Ma, and X. Zhang, “Detecting backdoors in pre-trained encoders,” in CVPR, 2023.

  260. I. Sur, K. Sikka, M. Walmer, K. Koneripalli, A. Roy, X. Lin, A. Divakaran, and S. Jha, “Tijo: Trigger inversion with joint optimization for defending multimodal backdoored models,” in ICCV, 2023.

  261. H. Liu, M. K. Reiter, and N. Z. Gong, “Mudjacking: Patching backdoor vulnerabilities in foundation models,” in USENIX Security, 2024.

  262. L. Zhu, R. Ning, J. Li, C. Xin, and H. Wu, “Seer: Backdoor detection for vision-language models through searching target text and image trigger jointly,” in AAAI, 2024.

  263. H. Huang, S. Erfani, Y. Li, X. Ma, and J. Bailey, “Detecting backdoor samples in contrastive language image pretraining,” in ICLR, 2025.

  264. C. Schlarmann and M. Hein, “On the adversarial robustness of multi-modal foundation models,” in ICCV, 2023.

  265. X. Cui, A. Aparcedo, Y. K. Jang, and S.-N. Lim, “On the robustness of large multimodal models against image adversarial attacks,” in CVPR, 2024.

  266. H. Luo, J. Gu, F. Liu, and P. Torr, “An image is worth 1000 lies: Transferability of adversarial images across prompts on vision-language models,” in ICLR, 2024.

  267. K. Gao, Y. Bai, J. Bai, Y. Yang, and S.-T. Xia, “Adversarial robustness for visual grounding of multimodal large language models,” in ICLR Workshop, 2024.

  268. Z. Wang, Z. Han, S. Chen, F. Xue, Z. Ding, X. Xiao, V. Tresp, P. Torr, and J. Gu, “Stop reasoning! when multimodal LLM with chain-of-thought reasoning meets adversarial image,” in COLM, 2024.

  269. X. Wang, Z. Ji, P. Ma, Z. Li, and S. Wang, “Instructta: Instruction-tuned targeted attack for large vision-language models,” arXiv preprint arXiv:2312.01886, 2023.

  270. Y. Dong, H. Chen, J. Chen, Z. Fang, X. Yang, Y. Zhang, Y. Tian, H. Su, and J. Zhu, “How robust is google’s bard to adversarial image attacks?” in NeurIPS Workshop, 2023.

  271. Y. Zhao, T. Pang, C. Du, X. Yang, C. Li, N.-M. M. Cheung, and M. Lin, “On evaluating adversarial robustness of large vision-language models,” in NeurIPS, 2024.

  272. Q. Guo, S. Pang, X. Jia, and Q. Guo, “Efficiently adversarial examples generation for visual-language models under targeted transfer scenarios using diffusion models,” arXiv preprint arXiv:2404.10335, 2024.

  273. J. Zhang, J. Ye, X. Ma, Y. Li, Y. Yang, J. Sang, and D.-Y. Yeung, “Anyattack: Towards large-scale self-supervised generation of targeted adversarial examples for vision-language models,” arXiv preprint arXiv:2410.05346, 2024.

  274. L. Bailey, E. Ong, S. Russell, and S. Emmons, “Image hijacks: Adversarial images can control generative models at runtime,” arXiv preprint arXiv:2309.00236, 2023.

  275. N. Carlini, M. Nasr, C. A. Choquette-Choo, M. Jagielski, I. Gao, P. W. W. Koh, D. Ippolito, F. Tramer, and L. Schmidt, “Are aligned neural networks adversarially aligned?” NeurIPS, 2024.

  276. X. Qi, K. Huang, A. Panda, P. Henderson, M. Wang, and P. Mittal, “Visual adversarial examples jailbreak aligned large language models,” in AAAI, 2024.

  277. Z. Niu, H. Ren, X. Gao, G. Hua, and R. Jin, “Jailbreaking attack against multimodal large language model,” arXiv preprint arXiv:2402.02309, 2024.

  278. R. Wang, X. Ma, H. Zhou, C. Ji, G. Ye, and Y.-G. Jiang, “White-box multimodal jailbreaks against large vision-language models,” in ACM MM, 2024.

  279. Y. Li, H. Guo, K. Zhou, W. X. Zhao, and J.-R. Wen, “Images are achilles’ heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models,” in ECCV, 2024.

  280. E. Shayegani, Y. Dong, and N. Abu-Ghazaleh, “Jailbreak in pieces: Compositional adversarial attacks on multi-modal language models,” in ICLR, 2023.

  281. Y. Gong, D. Ran, J. Liu, C. Wang, T. Cong, A. Wang, S. Duan, and X. Wang, “Figstep: Jailbreaking large vision-language models via typographic visual prompts,” in AAAI, 2025.

  282. Y. Wu, X. Li, Y. Liu, P. Zhou, and L. Sun, “Jailbreaking gpt-4v via self-adversarial attacks with system prompts,” arXiv preprint arXiv:2311.09127, 2023.

  283. S. Ma, W. Luo, Y. Wang, X. Liu, M. Chen, B. Li, and C. Xiao, “Visual-roleplay: Universal jailbreak attack on multimodal large language models via role-playing image character,” arXiv preprint arXiv:2405.20773, 2024.

  284. R. Wang, J. Li, Y. Wang, B. Wang, X. Wang, Y. Teng, Y. Wang, X. Ma, and Y.-G. Jiang, “Ideator: Jailbreaking and benchmarking large vision-language models using themselves,” ICCV, 2025.

  285. X. Zhang, C. Zhang, T. Li, Y. Huang, X. Jia, X. Xie, Y. Liu, and C. Shen, “A mutation-based method for multi-modal jailbreaking attack detection,” arXiv preprint arXiv:2312.10766, 2023.

  286. R. K. Sharma, V. Gupta, and D. Grossman, “Defending language models against image-based prompt attacks via user-provided specifications,” in IEEE SPW, 2024.

  287. Y. Wang, X. Liu, Y. Li, M. Chen, and C. Xiao, “Adashield: Safeguarding multimodal large language models from structure-based attack via adaptive shield prompting,” in ECCV, 2024.

  288. R. Pi, T. Han, Y. Xie, R. Pan, Q. Lian, H. Dong, J. Zhang, and T. Zhang, “Mllm-protector: Ensuring mllm’s safety without hurting performance,” in EMNLP, 2024.

  289. Y. Gou, K. Chen, Z. Liu, L. Hong, H. Xu, Z. Li, D.-Y. Yeung, J. T. Kwok, and Y. Zhang, “Eyes closed, safety on: Protecting multimodal llms via image-to-text transformation,” in ECCV, 2024.

  290. P. Wang, D. Zhang, L. Li, C. Tan, X. Wang, K. Ren, B. Jiang, and X. Qiu, “Inferaligner: Inference-time alignment for harmlessness through cross-model guidance,” in EMNLP, 2024.

  291. Y. Zhao, X. Zheng, L. Luo, Y. Li, X. Ma, and Y.-G. Jiang, “Bluesuffix: Reinforced blue teaming for vision-language models against jailbreak attacks,” in ICLR, 2025.

  292. K. Gao, Y. Bai, J. Gu, S.-T. Xia, P. Torr, Z. Li, and W. Liu, “Inducing high energy-latency of large vision-language models with verbose images,” in ICLR, 2024.

  293. E. Bagdasaryan, T.-Y. Hsieh, B. Nassi, and V. Shmatikov, “(ab) using images and sounds for indirect instruction injection in multi-modal llms,” arXiv preprint arXiv:2307.10490, 2023.

  294. M. Qraitem, N. Tasnim, K. Saenko, and B. A. Plummer, “Vision-llms can fool themselves with self-generated typographic attacks,” arXiv preprint arXiv:2402.00626, 2024.

  295. S. Liang, J. Liang, T. Pang, C. Du, A. Liu, E.-C. Chang, and X. Cao, “Revisiting backdoor attacks against large vision-language models,” arXiv preprint arXiv:2406.18844, 2024.

  296. D. Lu, T. Pang, C. Du, Q. Liu, X. Yang, and M. Lin, “Test-time backdoor attacks on multimodal large language models,” arXiv preprint arXiv:2402.08577, 2024.

  297. Z. Ni, R. Ye, Y. Wei, Z. Xiang, Y. Wang, and S. Chen, “Physical backdoor attack can jeopardize driving with vision-large-language models,” in ICML Workshop, 2024.

  298. X. Tao, S. Zhong, L. Li, Q. Liu, and L. Kong, “Imgtrojan: Jailbreaking vision-language models with one image,” arXiv preprint arXiv:2403.02910, 2024.

  299. Y. Xu, J. Yao, M. Shu, Y. Sun, Z. Wu, N. Yu, T. Goldstein, and F. Huang, “Shadowcast: Stealthy data poisoning attacks against vision-language models,” in NeurIPS, 2024.

  300. C. Du, Y. Li, Z. Qiu, and C. Xu, “Stable diffusion is unstable,” NeurIPS, 2024.

  301. Q. Liu, A. Kortylewski, Y. Bai, S. Bai, and A. Yuille, “Discovering failure modes of text-guided diffusion models via adversarial search,” in ICLR, 2024.

  302. Q. Zhou, D. Wang, T. Li, Z. Xu, Y. Liu, K. Ren, W. Wang, and Q. Guo, “Foolsdedit: Deceptively steering your edits towards targeted attribute-aware distribution,” arXiv preprint arXiv:2402.03705, 2024.

  303. H. Zhuang, Y. Zhang, and S. Liu, “A pilot study of query-free adversarial attack against stable diffusion,” in CVPR, 2023.

  304. C. Zhang, L. Wang, and A. Liu, “Revealing vulnerabilities in stable diffusion via targeted attacks,” arXiv preprint arXiv:2401.08725, 2024.

  305. D. Yang, Y. Bai, X. Jia, Y. Liu, X. Cao, and W. Yu, “On the multi-modal vulnerability of diffusion models,” in TiFA, 2024.

  306. J. Zhou, M. Wang, T. Li, G. Meng, and K. Chen, “Dormant: Defending against pose-driven human image animation,” arXiv preprint arXiv:2409.14424, vol. 8, 2024.

  307. L. Struppek, D. Hintersdorf, F. Friedrich, P. Schramowski, K. Kersting et al., “Exploiting cultural biases via homoglyphs in text-to-image synthesis,” Journal of Artificial Intelligence Research, vol. 78, pp. 1017–1068, 2023.

  308. Z. Kou, S. Pei, Y. Tian, and X. Zhang, “Character as pixels: A controllable prompt adversarial attacking framework for black-box text guided image generation models.” in IJCAI, 2023.

  309. H. Gao, H. Zhang, Y. Dong, and Z. Deng, “Evaluating the robustness of text-to-image diffusion models against real-world attacks,” arXiv preprint arXiv:2306.13103, 2023.

  310. G. Daras and A. G. Dimakis, “Discovering the hidden vocabulary of dalle-2,” arXiv preprint arXiv:2206.00169, 2022.

  311. R. Millière, “Adversarial attacks on image generation with made-up words,” arXiv preprint arXiv:2208.04135, 2022.

  312. N. Maus, P. Chao, E. Wong, and J. R. Gardner, “Black box adversarial prompting for foundation models,” in NFAML, 2023.

  313. H. Liu, Y. Wu, S. Zhai, B. Yuan, and N. Zhang, “Riatig: Reliable and imperceptible adversarial text-to-image generation with natural prompts,” in CVPR, 2023.

  314. J. Rando, D. Paleka, D. Lindner, L. Heim, and F. Tramèr, “Red-teaming the stable diffusion safety filter,” arXiv preprint arXiv:2210.04610, 2022.

  315. Y. Yang, R. Gao, X. Wang, T.-Y. Ho, N. Xu, and Q. Xu, “Mma-diffusion: Multimodal attack on diffusion models,” in CVPR, 2024.

  316. Z.-Y. Chin, C.-M. Jiang, C.-C. Huang, P.-Y. Chen, and W.-C. Chiu, “Prompting4debugging: Red-teaming text-to-image diffusion models by finding problematic prompts,” in ICML, 2024.

  317. Y. Zhang, J. Jia, X. Chen, A. Chen, Y. Zhang, J. Liu, K. Ding, and S. Liu, “To generate or not? safety-driven unlearned diffusion models are still easy to generate unsafe images… for now,” arXiv preprint arXiv:2310.11868, 2023.

  318. J. Ma, A. Cao, Z. Xiao, J. Zhang, C. Ye, and J. Zhao, “Jailbreaking prompt attack: A controllable adversarial attack against diffusion models,” arXiv preprint arXiv:2404.02928, 2024.

  319. S. Gao, X. Jia, Y. Huang, R. Duan, J. Gu, Y. Liu, and Q. Guo, “Rt-attack: Jailbreaking text-to-image models via random token,” arXiv preprint arXiv:2408.13896, 2024.

  320. Y. Yang, B. Hui, H. Yuan, N. Gong, and Y. Cao, “Sneakyprompt: Jailbreaking text-to-image generative models,” in IEEE S&P, 2024.

  321. Y. Qu, X. Shen, X. He, M. Backes, S. Zannettou, and Y. Zhang, “Unsafe diffusion: On the generation of unsafe images and hateful memes from text-to-image models,” in CCS, 2023.

  322. Y. Dong, Z. Li, X. Meng, N. Yu, and S. Guo, “Jailbreaking text-to-image models with llm-based agents,” arXiv preprint arXiv:2408.00523, 2024.

  323. Y. Liu, G. Yang, G. Deng, F. Chen, Y. Chen, L. Shi, T. Zhang, and Y. Liu, “Groot: Adversarial testing for generative text-to-image models with tree-based semantic transformation,” arXiv preprint arXiv:2402.12100, 2024.

  324. Y. Deng and H. Chen, “Divide-and-conquer attack: Harnessing the power of llm to bypass the censorship of text-to-image generation model,” arXiv preprint arXiv:2312.07130, 2023.

  325. Z. Ba, J. Zhong, J. Lei, P. Cheng, Q. Wang, Z. Qin, Z. Wang, and K. Ren, “Surrogateprompt: Bypassing the safety filter of text-to-image models via substitution,” in CCS, 2024.

  326. Y. Huang, L. Liang, T. Li, X. Jia, R. Wang, W. Miao, G. Pu, and Y. Liu, “Perception-guided jailbreak against text-to-image models,” in AAAI, vol. 39, no. 25, 2025, p. 26238–26247.

  327. C. Zhang, L. Wang, Y. Ma, W. Li, and A.-A. Liu, “Reason2attack: Jailbreaking text-to-image models via llm reasoning,” arXiv preprint arXiv:2503.17987, 2025.

  328. R. Gandikota, J. Materzynska, J. Fiotto-Kaufman, and D. Bau, “Erasing concepts from diffusion models,” in ICCV, 2023.

  329. M. Lyu, Y. Yang, H. Hong, H. Chen, X. Jin, Y. He, H. Xue, J. Han, and G. Ding, “One-dimensional adapter to rule them all: Concepts diffusion models and erasing applications,” in CVPR, 2024.

  330. S. Kim, S. Jung, B. Kim, M. Choi, J. Shin, and J. Lee, “Towards safe self-distillation of internet-scale text-to-image diffusion models,” in ICML Workshop, 2023.

  331. N. Kumari, B. Zhang, S.-Y. Wang, E. Shechtman, R. Zhang, and J.-Y. Zhu, “Ablating concepts in text-to-image diffusion models,” in ICCV, 2023.

  332. S. Hong, J. Lee, and S. S. Woo, “All but one: Surgical concept erasing with model preservation in text-to-image diffusion models,” in AAAI, 2024.

  333. Y. Wu, S. Zhou, M. Yang, L. Wang, W. Zhu, H. Chang, X. Zhou, and X. Yang, “Unlearning concepts in diffusion model via concept domain correction and concept preserving gradient,” arXiv preprint arXiv:2405.15304, 2024.

  334. A. Heng and H. Soh, “Selective amnesia: A continual learning approach to forgetting in deep generative models,” NeurIPS, 2024.

  335. C.-P. Huang, K.-P. Chang, C.-T. Tsai, Y.-H. Lai, and Y.-C. F. Wang, “Receler: Reliable concept erasing of text-to-image diffusion models via lightweight erasers,” in ECCV, 2024.

  336. C. Kim, K. Min, and Y. Yang, “Race: Robust adversarial concept erasure for secure text-to-image diffusion model,” in ECCV, 2024.

  337. Y. Zhang, X. Chen, J. Jia, Y. Zhang, C. Fan, J. Liu, M. Hong, K. Ding, and S. Liu, “Defensive unlearning with adversarial training for robust concept erasure in diffusion models,” in NeurIPS, 2024.

  338. Z. u. Ni, L. p. Wei, J. u. Li, S. Tang, Y. Zhuang, and Q. m. Tian, “Degeneration-tuning: Using scrambled grid shield unwanted concepts from stable diffusion,” in ACM MM, 2023.

  339. G. Zhang, K. Wang, X. Xu, Z. Wang, and H. Shi, “Forget-me-not: Learning to forget in text-to-image diffusion models,” in CVPR, 2024.

  340. Z. Liu, K. Chen, Y. Zhang, J. Han, L. Hong, H. Xu, Z. Li, D.-Y. Yeung, and J. Kwok, “Implicit concept removal of diffusion models,” arXiv preprint arXiv:2310.05873, 2024.

  341. M. Zhao, L. Zhang, T. Zheng, Y. Kong, and B. Yin, “Separable multi-concept erasure from diffusion models,” arXiv preprint arXiv:2402.05947, 2024.

  342. T. Han, W. Sun, Y. Hu, C. Fang, Y. Zhang, S. Ma, T. Zheng, Z. Chen, and Z. Wang, “Continuous concepts removal in text-to-image diffusion models,” arXiv preprint arXiv:2412.00580, 2024.

  343. X. Li, Y. Yang, J. Deng, C. Yan, Y. Chen, X. Ji, and W. Xu, “Safegen: Mitigating sexually explicit content generation in text-to-image models,” in Proceedings of the 2024 on ACM SIGSAC Conference on Computer and Communications Security, 2024, pp. 4807–4821.

  344. B. H. Lee, S. Lim, S. Lee, D. U. Kang, and S. Y. Chun, “Concept pinpoint eraser for text-to-image diffusion models via residual attention gate,” arXiv preprint arXiv:2506.22806, 2025.

  345. S. Lu, Z. Wang, L. Li, Y. Liu, and A. W.-K. Kong, “Mace: Mass concept erasure in diffusion models,” in CVPR, 2024.

  346. R. Gandikota, H. Orgad, Y. Belinkov, J. Materzyńska, and D. Bau, “Unified concept editing in diffusion models,” in WACV, 2024.

  347. H. Orgad, B. Kawar, and Y. Belinkov, “Editing implicit assumptions in text-to-image diffusion models,” in ICCV, 2023.

  348. C. Gong, K. Chen, Z. Wei, J. Chen, and Y.-G. Jiang, “Reliable and efficient concept erasure of text-to-image diffusion models,” in ECCV, 2024.

  349. Y. Liu, J. An, W. Zhang, M. Li, D. Wu, J. Gu, Z. Lin, and W. Wang, “Realera: Semantic-level concept erasure via neighbor-concept mining,” arXiv preprint arXiv:2410.09140, 2024.

  350. R. Chavhan, D. Li, and T. Hospedales, “Conceptprune: Concept editing in diffusion models via skilled neuron pruning,” in NeurIPS, 2024.

  351. T. Yang, Z. Li, J. Cao, and C. Xu, “Pruning for robust concept erasing in diffusion models,” in Neurips Workshop, 2024.

  352. P. Schramowski, M. Brack, B. Deiseroth, and K. Kersting, “Safe latent diffusion: Mitigating inappropriate degeneration in diffusion models,” in CVPR, 2023.

  353. L. Yuan, X. Jia, Y. Huang, W. Dong, and Y. Liu, “Promptguard: Soft prompt-guided unsafe content moderation for text-to-image models,” arXiv preprint arXiv:2501.03544, 2025.

  354. Y. Cai, S. Yin, Y. Wei, C. Xu, W. Mao, F. Juefei-Xu, S. Chen, and Y. Wang, “Ethical-lens: Curbing malicious usages of open-source text-to-image models,” arXiv preprint arXiv:2404.12104, 2024.

  355. H. Li, C. Shen, P. Torr, V. Tresp, and J. Gu, “Self-discovering interpretable diffusion latent directions for responsible text-to-image generation,” in CVPR, 2024.

  356. Z. Meng, B. Peng, X. Jin, Y. Lyu, W. Wang, and J. Dong, “Concept corrector: Erase concepts on the fly for text-to-image diffusion models,” arXiv preprint arXiv:2502.16368, 2025.

  357. S.-Y. Chou, P.-Y. Chen, and T.-Y. Ho, “How to backdoor diffusion models?” in CVPR, 2023.

  358. Sheng-Yen Chou, Pin-Yu Chen, and Tsung-Yi Ho, “Villandiffusion: A unified backdoor attack framework for diffusion models,” in NeurIPS, 2024.

  359. W. Chen, D. Song, and B. Li, “Trojdiff: Trojan attacks on diffusion models with diverse targets,” in CVPR, 2023.

  360. S. Li, J. Ma, and M. Cheng, “Invisible backdoor attacks on diffusion models,” arXiv preprint arXiv:2406.00816, 2024.

  361. C. Li, R. Pang, B. Cao, J. Chen, F. Ma, S. Ji, and T. Wang, “Watch the watcher! backdoor attacks on security-enhancing diffusion models,” arXiv preprint arXiv:2406.09669, 2024.

  362. L. Struppek, D. Hintersdorf, and K. Kersting, “Rickrolling the artist: Injecting backdoors into text encoders for text-to-image synthesis,” in ICCV, 2023.

  363. S. Zhai, Y. Dong, Q. Shen, S. Pu, Y. Fang, and H. Su, “Text-to-image diffusion models can be easily backdoored through multimodal data poisoning,” in ACM MM, 2023.

  364. Z. Pan, Y. Yao, G. Liu, B. Shen, H. V. Zhao, R. R. Kompella, and S. Liu, “From trojan horses to castle walls: Unveiling bilateral backdoor effects in diffusion models,” in NeurIPS Workshop, 2024.

  365. J. Vice, N. Akhtar, R. Hartley, and A. Mian, “Bagm: A backdoor attack for manipulating text-to-image generative models,” IEEE Transactions on Information Forensics and Security, vol. 19, pp. 4865–4880, 2024.

  366. Y. Huang, Q. Guo, and F. Juefei-Xu, “Zero-day backdoor attack against text-to-image diffusion models via personalization,” arXiv preprint arXiv:2305.10701, 2023.

  367. Y. Huang, F. Juefei-Xu, Q. Guo, J. Zhang, Y. Wu, M. Hu, T. Li, G. Pu, and Y. Liu, “Personalization as a shortcut for few-shot backdoor attack against text-to-image diffusion models,” in AAAI, 2024.

  368. H. Wang, Q. Shen, Y. Tong, Y. Zhang, and K. Kawaguchi, “The stronger the diffusion model, the easier the backdoor: Data poisoning to induce copyright breaches without adjusting finetuning pipeline,” in NeurIPS Workshop, 2024.

  369. A. Naseh, J. Roh, E. Bagdasaryan, and A. Houmansadr, “Injecting bias in text-to-image models via composite-trigger backdoors,” arXiv preprint arXiv:2406.15213, 2024.

  370. Z. Wang, J. Zhang, S. Shan, and X. Chen, “T2ishield: Defending against backdoors on text-to-image diffusion models,” in ECCV, 2024.

  371. Z. Guan, M. Hu, S. Li, and A. K. Vullikanti, “Ufid: A unified framework for black-box input-level backdoor detection on diffusion models,” in AAAI, 2025.

  372. Y. Sui, H. Phan, J. Xiao, T. Zhang, Z. Tang, C. Shi, Y. Wang, Y. Chen, and B. Yuan, “Disdet: Exploring detectability of backdoor attack on diffusion models,” arXiv preprint arXiv:2402.02739, 2024.

  373. S. An, S.-Y. Chou, K. Zhang, Q. Xu, G. Tao, G. Shen, S. Cheng, S. Ma, P.-Y. Chen, T.-Y. Ho et al., “Elijah: Eliminating backdoors injected in diffusion models via distribution shift,” in AAAI, 2024.

  374. J. Hao, X. Jin, H. Xiaoguang, and C. Tianyou, “Diff-cleanse: Identifying and mitigating backdoor attacks in diffusion models,” arXiv preprint arXiv:2407.21316, 2024.

  375. Y. Mo, H. Huang, M. Li, A. Li, and Y. Wang, “TERD: A unified framework for safeguarding diffusion models against backdoors,” in ICML, 2024.

  376. V. T. Truong and L. B. Le, “Purediffusion: Using backdoor to counter backdoor in generative diffusion models,” arXiv preprint arXiv:2409.13945, 2024.

  377. S. Zhai, J. Li, Y. Liu, H. Chen, Z. Tian, W. Qu, Q. Shen, R. Jia, Y. Dong, and J. Zhang, “Navidet: Efficient input-level backdoor detection on text-to-image synthesis via neuron activation variation,” arXiv preprint arXiv:2503.06453, 2025.

  378. J. Dubiński, A. Kowalczuk, S. Pawlak, P. Rokita, T. Trzciński, and P. Morawiecki, “Towards more realistic membership inference attacks on large diffusion models,” in WACV, 2024.

  379. Y. Pang, T. Wang, X. Kang, M. Huai, and Y. Zhang, “White-box membership inference attacks against diffusion models,” arXiv preprint arXiv:2308.06405, 2023.

  380. T. Matsumoto, T. Miura, and N. Yanai, “Membership inference attacks against diffusion models,” in SPW, 2023.

  381. H. Hu and J. Pang, “Loss and likelihood based membership inference of diffusion models,” in ICIS, 2023.

  382. J. Duan, F. Kong, S. Wang, X. Shi, and K. Xu, “Are diffusion models vulnerable to membership inference attacks?” in ICML, 2023.

  383. S. Tang, Z. S. Wu, S. Aydore, M. Kearns, and A. Roth, “Membership inference attacks on diffusion models via quantile regression,” arXiv preprint arXiv:2312.05140, 2023.

  384. F. Kong, J. Duan, R. Ma, H. T. Shen, X. Shi, X. Zhu, and K. Xu, “An efficient membership inference attack for the diffusion model by proximal initialization,” in ICLR, 2024.

  385. W. Fu, H. Wang, C. Gao, G. Liu, Y. Li, and T. Jiang, “A probabilistic fluctuation based membership inference attack for generative models,” arXiv preprint arXiv:2308.12143, 2023.

  386. S. Zhai, H. Chen, Y. Dong, J. Li, Q. Shen, Y. Gao, H. Su, and Y. Liu, “Membership inference on text-to-image diffusion models via conditional likelihood discrepancy,” in NeurIPS, 2024.

  387. Q. Li, X. Fu, X. Wang, J. Liu, X. Gao, J. Dai, and J. Han, “Unveiling structural memorization: Structural membership inference attack for text-to-image diffusion models,” in ACM MM, 2024.

  388. Y. Wu, N. Yu, Z. Li, M. Backes, and Y. Zhang, “Membership inference attacks against text-to-image generation models,” arXiv preprint arXiv:2210.00968, 2022.

  389. Y. Pang and T. Wang, “Black-box membership inference attacks against fine-tuned diffusion models,” arXiv preprint arXiv:2312.08207, 2023.

  390. J. Li, J. Dong, T. He, and J. Zhang, “Towards black-box membership inference attack for diffusion models,” arXiv preprint arXiv:2405.20771, 2024.

  391. X. Fu, X. Wang, Q. Li, J. Liu, J. Dai, and J. Han, “Model will tell: Training membership inference for diffusion models,” arXiv preprint arXiv:2403.08487, 2024.

  392. M. Zhang, N. Yu, R. Wen, M. Backes, and Y. Zhang, “Generated distributions are all you need for membership inference attacks against generative models,” in CVPR, 2024.

  393. N. Carlini, J. Hayes, M. Nasr, M. Jagielski, V. Sehwag, F. Tramer, B. Balle, D. Ippolito, and E. Wallace, “Extracting training data from diffusion models,” in USENIX Security, 2023.

  394. R. Webster, “A reproducible extraction of training images from diffusion models,” arXiv preprint arXiv:2305.08694, 2023.

  395. Y. Chen, X. Ma, D. Zou, and Y.-G. Jiang, “Extracting training data from unconditional diffusion models,” arXiv preprint arXiv:2410.02467, 2024.

  396. X. Wu, J. Zhang, and S. Wu, “Revealing the unseen: Guiding personalized diffusion models to expose training data,” arXiv preprint arXiv:2410.03039, 2024.

  397. E. Horwitz, J. Kahana, and Y. Hoshen, “Recovering the pre-fine-tuning weights of generative models,” arXiv preprint arXiv:2402.10208, 2024.

  398. X. Ye, H. Huang, J. An, and Y. Wang, “DUAW: Data-free universal adversarial watermark against stable diffusion customization,” in ICLR Workshop, 2024.

  399. C. Liang, X. Wu, Y. Hua, J. Zhang, Y. Xue, T. Song, Z. Xue, R. Ma, and H. Guan, “Adversarial example does good: Preventing painting imitation from diffusion models via adversarial examples,” in ICML, 2023.

  400. T. Van Le, H. Phung, T. H. Nguyen, Q. Dao, N. N. Tran, and A. Tran, “Anti-dreambooth: Protecting users from personalized text-to-image synthesis,” in ICCV, 2023.

  401. Y. Liu, C. Fan, Y. Dai, X. Chen, P. Zhou, and L. Sun, “Metacloak: Preventing unauthorized subject-driven text-to-image diffusion-based synthesis via meta-learning,” in CVPR, 2024.

  402. H. Liu, Z. Sun, and Y. Mu, “Countering personalized text-to-image generation with influence watermarks,” in CVPR, 2024.

  403. F. Wang, Z. Tan, T. Wei, Y. Wu, and Q. Huang, “Simac: A simple anti-customization method for protecting face privacy against text-to-image synthesis of diffusion models,” in CVPR, 2024.

  404. X. Zhang, R. Li, J. Yu, Y. Xu, W. Li, and J. Zhang, “Editguard: Versatile image watermarking for tamper localization and copyright protection,” in CVPR, 2024.

  405. R. Min, S. Li, H. Chen, and M. Cheng, “A watermark-conditioned diffusion model for ip protection,” in 2024, 2024.

  406. P. Zhu, T. Takahashi, and H. Kataoka, “Watermark-embedded adversarial examples for copyright protection against diffusion models,” in CVPR, 2024.

  407. Y. Cui, J. Ren, Y. Lin, H. Xu, P. He, Y. Xing, W. Fan, H. Liu, and J. Tang, “Ft-shield: A watermark against unauthorized fine-tuning in text-to-image diffusion models,” arXiv preprint arXiv:2310.02401, 2023.

  408. Y. Cui, J. Ren, H. Xu, P. He, H. Liu, L. Sun, Y. Xing, and J. Tang, “Diffusionshield: A watermark for copyright protection against generative diffusion models,” in NeurIPS Workshop, 2023.

  409. V. Asnani, J. Collomosse, T. Bui, X. Liu, and S. Agarwal, “Promark: Proactive diffusion watermarking for causal attribution,” in CVPR, 2024.

  410. Z. Wang, C. Chen, L. Lyu, D. N. Metaxas, and S. Ma, “Diagnosis: Detecting unauthorized data usages in text-to-image diffusion models,” in ICLR, 2023.

  411. J. Zhu, R. Kaplan, J. Johnson, and L. Fei-Fei, “Hidden: Hiding data with deep networks,” in ECCV, 2018.

  412. P. Fernandez, G. Couairon, H. Jégou, M. Douze, and T. Furon, “The stable signature: Rooting watermarks in latent diffusion models,” in ICCV, 2023.

  413. A. Rezaei, M. Akbari, S. R. Alvar, A. Fatemi, and Y. Zhang, “Lawa: Using latent space for in-generation image watermarking,” in ECCV, 2024.

  414. Z. Ma, G. Jia, B. Qi, and B. Zhou, “Safe-sd: Safe and traceable stable diffusion with text prompt trigger for invisible generative watermarking,” in ACM MM, 2024.

  415. Y. Zhao, T. Pang, C. Du, X. Yang, N.-M. Cheung, and M. Lin, “A recipe for watermarking diffusion models,” arXiv preprint arXiv:2303.10137, 2023.

  416. Y. Liu, Z. Li, M. Backes, Y. Shen, and Y. Zhang, “Watermarking diffusion model,” arXiv preprint arXiv:2305.12502, 2023.

  417. S. Peng, Y. Chen, C. Wang, and X. Jia, “Protecting the intellectual property of diffusion models by the watermark diffusion process,” arXiv preprint arXiv:2306.03436, vol. 3, 2023.

  418. W. Feng, W. Zhou, J. He, J. Zhang, T. Wei, G. Li, T. Zhang, W. Zhang, and N. Yu, “Aqualora: Toward white-box protection for customized stable diffusion models via watermark lora,” in ICML, 2024.

  419. Z. Wang, V. Sehwag, C. Chen, L. Lyu, D. N. Metaxas, and S. Ma, “How to trace latent generative model generated images without artificial watermark?” in ICML, 2024.

  420. Y. Wen, J. Kirchenbauer, J. Geiping, and T. Goldstein, “Tree-ring watermarks: Fingerprints for diffusion images that are invisible and robust,” in NeurIPS, 2023.

  421. F. Wu, N. Zhang, S. Jha, P. McDaniel, and C. Xiao, “A new era in llm security: Exploring security concerns in real-world llm-based systems,” arXiv preprint arXiv:2402.18649, 2024.

  422. S. Toyer, O. Watkins, E. A. Mendes, J. Svegliato, L. Bailey, T. Wang, I. Ong, K. Elmaaroufi, P. Abbeel, T. Darrell et al., “Tensor trust: Interpretable prompt injection attacks from an online game,” arXiv preprint arXiv:2311.01011, 2023.

  423. R. Pedro, D. Castro, P. Carreira, and N. Santos, “From prompt injections to sql injection attacks: How protected is your llm-integrated web application?” arXiv preprint arXiv:2308.01990, 2023.

  424. Q. Zhan, R. Fang, H. S. Panchal, and D. Kang, “Adaptive attacks break defenses against indirect prompt injection attacks on LLM agents,” in NAACL, 2025.

  425. G. Deng, Y. Liu, K. Wang, Y. Li, T. Zhang, and Y. Liu, “Pandora: Jailbreak gpts by retrieval augmented generation poisoning,” arXiv preprint arXiv:2402.08416, 2024.

  426. X. Fu, S. Li, Z. Wang, Y. Liu, R. K. Gupta, T. Berg-Kirkpatrick, and E. Fernandes, “Imprompter: Tricking llm agents into improper tool use,” arXiv preprint arXiv:2410.14923, 2024.

  427. E. Wallace, K. Xiao, R. Leike, L. Weng, J. Heidecke, and A. Beutel, “The instruction hierarchy: Training llms to prioritize privileged instructions,” arXiv preprint arXiv:2404.13208, 2024.

  428. T. Wen et al., “Defending against indirect prompt injection by instruction detection,” arXiv preprint arXiv:2505.06311, 2025.

  429. J. Wang, F. Wu, W. Li, J. Pan, E. Suh, Z. M. Mao, M. Chen, and C. Xiao, “Fath: Authentication-based test-time defense against indirect prompt injection attacks,” arXiv preprint arXiv:2410.21492, 2024.

  430. K. Hines, G. Lopez, M. Hall, F. Zarfati, Y. Zunger, and E. Kiciman, “Defending against indirect prompt injection attacks with spotlighting,” arXiv preprint arXiv:2403.14720, 2024.

  431. Y. Chen et al., “Can indirect prompt injection attacks be detected and removed?” arXiv preprint arXiv:2502.16580, 2025.

  432. L. Beurer-Kellner, B. B. A.-M. Creţu, E. Debenedetti, D. Dobos, D. Fabian, M. Fischer, D. Froelicher, K. Grosse, D. Naeff, E. Ozoani et al., “Design patterns for securing llm agents against prompt injections,” arXiv preprint arXiv:2506.08837, 2025.

  433. F. Jia, Y. Chen, and X. Wang, “The task shield: Enforcing task alignment to defend against indirect prompt injection in llm agents,” arXiv preprint arXiv:2412.16682, 2024.

  434. A. Liu, Y. Zhou, X. Liu, T. Zhang, S. Liang, J. Wang, Y. Pu, T. Li, J. Zhang, W. Zhou et al., “Compromising embodied agents with contextual backdoor attacks,” arXiv preprint arXiv:2408.02882, 2024.

  435. P. Zhu, Z. Zhou, Y. Zhang, S. Yan, K. Wang, and S. Su, “Demonagent: Dynamically encrypted multi-backdoor implantation attack on llm-based agent,” arXiv preprint arXiv:2502.12575, 2025.

  436. Z. Chen, Z. Xiang, C. Xiao, D. Song, and B. Li, “Agentpoison: Red-teaming llm agents via poisoning memory or knowledge bases,” arXiv preprint arXiv:2407.12784, 2024.

  437. J. Xue, M. Zheng, Y. Hu, F. Liu, X. Chen, and Q. Lou, “Badrag: Identifying vulnerabilities in retrieval augmented generation of large language models,” arXiv preprint arXiv:2406.00083, 2024.

  438. H. Chaudhari, G. Severi, J. Abascal, M. Jagielski, C. A. Choquette-Choo, M. Nasr, C. Nita-Rotaru, and A. Oprea, “Phantom: General trigger attacks on retrieval augmented language generation,” arXiv preprint arXiv:2405.20485, 2024.

  439. W. Yang, X. Bi, Y. Lin, S. Chen, J. Zhou, and X. Sun, “Watch out for your agents! investigating backdoor threats to llm-based agents,” in NeurIPS, 2024.

  440. Y. Wang, D. Xue, S. Zhang, and S. Qian, “Badagent: Inserting and activating backdoor attacks in llm agents,” in ACL, 2024.

  441. B. Zhang, Y. Tan, Y. Shen, A. Salem, M. Backes, S. Zannettou, and Y. Zhang, “Breaking agents: Compromising autonomous llm agents through malfunction amplification,” arXiv preprint arXiv:2407.20859, 2024.

  442. S. Dong, S. Xu, P. He, Y. Li, J. Tang, T. Liu, H. Liu, and Z. Xiang, “A practical memory injection attack against llm agents,” arXiv preprint arXiv:2503.03704, 2025.

  443. W. Zou, R. Geng, B. Wang, and J. Jia, “Poisonedrag: Knowledge corruption attacks to retrieval-augmented generation of large language models,” arXiv preprint arXiv:2402.07867, 2024.

  444. Z. Zhong, Z. Huang, A. Wettig, and D. Chen, “Poisoning retrieval corpora by injecting adversarial passages,” arXiv preprint arXiv:2310.19156, 2023.

  445. H. Luo, T. Zhang, Y.-S. Chuang, Y. Gong, Y. Kim, X. Wu, H. Meng, and J. Glass, “Search augmented instruction learning,” in EMNLP, 2023.

  446. M. Geng, S. Wang, D. Dong, H. Wang, G. Li, Z. Jin, X. Mao, and X. Liao, “Large language models are few-shot summarizers: Multi-intent comment generation via in-context learning,” in ICSE, 2024.

  447. D. Agarwal, A. R. Fabbri, B. Risher, P. Laban, S. Joty, and C.-S. Wu, “Prompt leakage effect and defense strategies for multi-turn llm interactions,” arXiv preprint arXiv:2404.16251, 2024.

  448. J. Mao, F. Meng, Y. Duan, M. Yu, X. Jia, J. Fang, Y. Liang, K. Wang, and Q. Wen, “Agentsafe: Safeguarding large language model-based multi-agent systems via hierarchical data management,” arXiv preprint arXiv:2503.04392, 2025.

  449. H. Zhou, K.-H. Lee, Z. Zhan, Y. Chen, and Z. Li, “Trustrag: Enhancing robustness and trustworthiness in rag,” arXiv preprint arXiv:2501.00879, 2025.

  450. F. Wang, X. Wan, R. Sun, J. Chen, and S. Ö. Arık, “Astute rag: Overcoming imperfect retrieval augmentation and knowledge conflicts for large language models,” arXiv preprint arXiv:2410.07176, 2024.

  451. C. Xiang, T. Wu, Z. Zhong, D. Wagner, D. Chen, and P. Mittal, “Certifiably robust rag against retrieval corruption,” arXiv preprint arXiv:2405.15556, 2024.

  452. J. Zhang, S. Yang, and B. Li, “Udora: A unified red teaming framework against llm agents by dynamically hijacking their own reasoning,” arXiv preprint arXiv:2503.01908, 2025.

  453. J. Ye, S. Li, G. Li, C. Huang, S. Gao, Y. Wu, Q. Zhang, T. Gui, and X. Huang, “Toolsword: Unveiling safety issues of large language models in tool learning across three stages,” arXiv preprint arXiv:2402.10753, 2024.

  454. H. Wang, R. Zhang, J. Wang, M. Li, Y. Huang, D. Wang, and Q. Wang, “From allies to adversaries: Manipulating llm tool-calling through adversarial injection,” arXiv preprint arXiv:2412.10198, 2024.

  455. F. Wu, S. Wu, Y. Cao, and C. Xiao, “Wipi: A new web threat for llm-driven web agents,” arXiv preprint arXiv:2402.16965, 2024.

  456. Z. Jiang, M. Li, G. Yang, J. Wang, Y. Huang, Z. Chang, and Q. Wang, “Mimicking the familiar: Dynamic command generation for information theft attacks in llm tool-learning system,” in ACL, 2025.

  457. Z. Wang, H. Li, R. Zhang, Y. Liu, W. Jiang, W. Fan, Q. Zhao, and G. Xu, “Mpma: Preference manipulation attack against model context protocol,” arXiv preprint arXiv:2505.11154, 2025.

  458. M. A. Ferrag, M. Debbah, S. Ozawa, and K. Shu, “From prompt injections to protocol exploits: Threats in llm-powered ai agents workflows,” arXiv preprint arXiv:2506.23260, 2025.

  459. D. Kong, S. Lin, Z. Xu, Z. Wang, M. Li, Y. Li, Y. Zhang, Z. Sha, Y. Li, C. Lin et al., “A survey of llm-driven ai agent communication: Protocols, security risks, and defense countermeasures,” arXiv preprint arXiv:2506.19676, 2025.

  460. J. Chen and S. L. Cong, “Agentguard: Repurposing agentic orchestrator for safety evaluation of tool orchestration,” arXiv preprint arXiv:2502.09809, 2025.

  461. X. Zhang, H. Xu, Z. Ba, Z. Wang, Y. Hong, J. Liu, Z. Qin, and K. Ren, “Privacyasst: Safeguarding user privacy in tool-using large language model agents,” IEEE Transactions on Dependable and Secure Computing, vol. 21, no. 6, pp. 5242–5258, 2024.

  462. Z. Xiang, L. Zheng, Y. Li, J. Hong, Q. Li, H. Xie, J. Zhang, Z. Xiong, C. Xie, C. Yang et al., “Guardagent: Safeguard llm agents by a guard agent via knowledge-enabled reasoning,” arXiv preprint arXiv:2406.09187, 2024.

  463. H. Jing, H. Li, W. Hu, Q. Hu, H. Xu, T. Chu, P. Hu, and Y. Song, “Mcip: Protecting mcp safety via model contextual integrity protocol,” arXiv preprint arXiv:2505.14590, 2025.

  464. C. H. Wu, J. Y. Koh, R. Salakhutdinov, D. Fried, and A. Raghunathan, “Adversarial attacks on multimodal agents,” arXiv preprint arXiv:2406.12814, 2024.

  465. E. Bagdasaryan, T.-Y. Hsieh, B. Nassi, and V. Shmatikov, “(ab)using images and sounds for indirect instruction injection in multi-modal llms,” arXiv preprint arXiv:2307.10490, 2023.

  466. Z. Liao, H. Tang, O. D. Zhang, J. Wang, and D. Yang, “Eia: Environmental injection attack on generalist web agents for privacy leakage,” arXiv preprint arXiv:2409.11295, 2024.

  467. C. Xu, D. Zhang, E. Shi, B. Zhang, and D. S. Wang, “Advagent: Controllable blackbox red-teaming on web agents,” arXiv preprint arXiv:2410.17401, 2024.

  468. X. Ma, Z. Ruan, Y. Chen, R. Jin, and Z. Zhang, “Caution for the environment: Multimodal agents are susceptible to environmental distractions,” arXiv preprint arXiv:2408.02544, 2024.

  469. Y. Zhang, “Attacking vision-language computer agents via pop-ups,” arXiv preprint arXiv:2411.02391, 2024.

  470. X. Fu, Z. Wang, S. Li, R. K. Gupta, N. Mireshghallah, T. Berg-Kirkpatrick, and E. Fernandes, “Misusing tools in large language models with visual adversarial examples,” arXiv preprint arXiv:2310.03185, 2023.

  471. C. Chen, Z. Zhang, B. Guo, S. Ma, I. Khalilov, S. A. Gebreegziabher, Y. Ye, Z. Xiao, Y. Yao, T. Li et al., “The obvious invisible threat: Llm-powered gui agents’ vulnerability to fine-print injections,” arXiv preprint arXiv:2504.11281, 2025.

  472. J. Xu, Z. Niu, L. Xiang, X. Yang, and J. Li, “Safeguarding vision-language models against patched visual prompt injectors,” arXiv preprint arXiv:2405.10529, 2024.

  473. J. Li, N. Xu, H. Wang, X. Chen, and Y. Liu, “Bluesuffix: Reinforced blue teaming for vision-language models against jailbreak attacks,” arXiv preprint arXiv:2410.20971, 2024.

  474. L. Helff, S. Yamazaki, F. Jones, S. Mathur, and P. H. S. Torr, “Llavaguard: Vlm-based safeguards for vision dataset curation and safety assessment,” arXiv preprint arXiv:2406.05113, 2024.

  475. Y. Nian, S. Zhu, Y. Qin, L. Li, Z. Wang, C. Xiao, and Y. Zhao, “Jaildam: Jailbreak detection with adaptive memory for vision-language model,” arXiv preprint arXiv:2504.03770, 2025.

  476. D. Lee and M. Tiwari, “Prompt infection: Llm-to-llm prompt injection within multi-agent systems,” arXiv preprint arXiv:2410.07283, 2024.

  477. S. Cohen, R. Bitton, and B. Nassi, “Here comes the ai worm: Unleashing zero-click worms that target genai-powered applications,” arXiv preprint arXiv:2403.02817, 2024.

  478. T. Ju, Y. Wang, X. Ma, P. Cheng, H. Zhao, Y. Wang, L. Liu, J. Xie, Z. Zhang, and G. Liu, “Flooding spread of manipulated knowledge in llm-based multi-agent communities,” arXiv preprint arXiv:2407.07791, 2024.

  479. X. Gu, X. Zheng, T. Pang, C. Du, Q. Liu, Y. Wang, J. Jiang, and M. Lin, “Agent smith: A single image can jailbreak one million multimodal llm agents exponentially fast,” in ICML, 2024.

  480. Z. Zhou, Z. Li, J. Zhang, Y. Zhang, K. Wang, Y. Liu, and Q. Guo, “Corba: Contagious recursive blocking attacks on multi-agent systems based on large language models,” arXiv preprint arXiv:2502.14529, 2025.

  481. P. He, Y. Lin, S. Dong, H. Xu, Y. Xing, and H. Liu, “Red-teaming llm multi-agent systems via communication attacks,” arXiv preprint arXiv:2502.14847, 2025.

  482. Y. Tian, X. Yang, J. Zhang, Y. Dong, and H. Su, “Evil geniuses: Delving into the safety of llm-based agents,” arXiv preprint arXiv:2311.11855, 2023.

  483. Z. Tan, C. Zhao, R. Moraffah, Y. Li, Y. Kong, T. Chen, and H. Liu, “The wolf within: Covert injection of malice into mllm societies via an mllm operative,” arXiv preprint arXiv:2402.14859, 2024.

  484. S. Rahman, L. Jiang, J. Shiffer, G. Liu, S. Issaka, M. R. Parvez, H. Palangi, K.-W. Chang, Y. Choi, and S. Gabriel, “X-teaming: Multi-turn jailbreaks and defenses with adaptive multi-agents,” arXiv preprint arXiv:2504.13203, 2025.

  485. Y. Zeng, Y. Wu, X. Zhang, H. Wang, and Q. Wu, “Autodefense: Multi-agent LLM defense against jailbreak attacks,” in Neurips Workshop, 2024.

  486. Z. Zhang, Y. Zhang, L. Li, H. Gao, L. Wang, H. Lu, F. Zhao, Y. Qiao, and J. Shao, “Psysafe: A comprehensive framework for psychological-based attack, defense, and evaluation of multi-agent system safety,” arXiv preprint arXiv:2401.11880, 2024.

  487. M. Standen, J. Kim, and C. Szabo, “Adversarial machine learning attacks and defences in multi-agent reinforcement learning,” ACM Computing Surveys, vol. 57, no. 5, pp. 1–35, 2025.

  488. G. Lin, T. Tanaka, and Q. Zhao, “Large language model sentinel: Llm agent for adversarial purification,” arXiv preprint arXiv:2405.20770, 2024.

  489. C. Song, L. Ma, J. Zheng, J. Liao, H. Kuang, and L. Yang, “Audit-llm: Multi-agent collaboration for log-based insider threat detection,” arXiv preprint arXiv:2408.08902, 2024.

  490. H. Cheng, E. Xiao, C. Yu, Z. Yao, J. Cao, Q. Zhang, J. Wang, M. Sun, K. Xu, J. Gu, and R. Xu, “Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision-Language-Action Models,” arXiv preprint arXiv:2409.13174, 2024.

  491. A. A. Fime, Z. Hossain, S. Zaman, A. R. Shahid, and A. Imteaj, “Towards Trustworthy Autonomous Vehicles with Vision-Language Models Under Targeted and Untargeted Adversarial Attacks,” in CVPR Workshop, 2025.

  492. T. Wang, C. Han, J. C. Liang, W. Yang, D. Liu, L. X. Zhang, Q. Wang, J. Luo, and R. Tang, “Exploring the Adversarial Vulnerabilities of Vision-Language-Action Models in Robotics,” arXiv preprint arXiv:2411.13587, 2025.

  493. A. Robey, Z. Ravichandran, V. Kumar, H. Hassani, and G. J. Pappas, “Jailbreaking LLM-Controlled Robots,” arXiv preprint arXiv:2410.13691, 2024.

  494. H. Zhang, C. Zhu, X. Wang, Z. Zhou, C. Yin, M. Li, L. Xue, Y. Wang, S. Hu, A. Liu, P. Guo, and L. Y. Zhang, “BadRobot: Jailbreaking Embodied LLMs in the Physical World,” in ICLR, 2025.

  495. X. Lu, Z. Huang, X. Li, X. Ji, and W. Xu, “POEX: Understanding and Mitigating Policy Executable Jailbreak Attacks Against Embodied AI,” arXiv preprint arXiv:2412.16633, 2025.

  496. A. Liu, Y. Zhou, X. Liu, T. Zhang, S. Liang, J. Wang, Y. Pu, T. Li, J. Zhang, W. Zhou, Q. Guo, and D. Tao, “Compromising Embodied Agents with Contextual Backdoor Attacks,” arXiv preprint arXiv:2408.02882, 2024.

  497. R. Jiao, S. Xie, J. Yue, T. Sato, L. Wang, Y. Wang, Q. A. Chen, and Q. Zhu, “Can We Trust Embodied Agents? Exploring Backdoor Attacks Against Embodied LLM-Based Decision-Making Systems,” in ICLR, 2025.

  498. M. Li, S. Zhao, Q. Wang, K. Wang, Y. Zhou, S. Srivastava, C. Gokmen, T. Lee, L. E. Li, R. Zhang, W. Liu, P. Liang, L. Fei-Fei, J. Mao, and J. Wu, “Embodied Agent Interface: Benchmarking LLMs for Embodied Decision Making,” in NeurIPS, 2024.

  499. T. Tomilin, M. Fang, and M. Pechenizkiy, “HASARD: A Benchmark for Vision-Based Safe Reinforcement Learning in Embodied Agents,” in ICLR, 2025.

  500. T. Chakraborty, U. Ghosh, X. Zhang, F. F. Niloy, Y. Dong, J. Li, A. K. Roy-Chowdhury, and C. Song, “HEAL: An Empirical Study on Hallucinations in Embodied Agents Driven by Large Language Models,” arXiv preprint arXiv:2506.15065, 2025.

  501. Rongwu Xu, Brian Lin, Shujian Yang, Tianqi Zhang, Weiyan Shi, Tianwei Zhang, Zhixuan Fang, Wei Xu, and Han Qiu, “The earth is flat because…: Investigating llms’ belief towards misinformation via persuasive conversation,” in ACL, 2024.

  502. S. Karnik, Z.-W. Hong, N. Abhangi, Y.-C. Lin, T.-H. Wang, C. Dupuy, R. Gupta, and P. Agrawal, “Embodied Red Teaming for Auditing Robotic Foundation Models,” arXiv preprint arXiv:2411.18676, 2025.

  503. J. Zhou, K. Ye, J. Liu, T. Ma, Z. Wang, R. Qiu, K.-Y. Lin, Z. Zhao, and J. Liang, “Exploring the Limits of Vision-Language-Action Manipulations in Cross-Task Generalization,” arXiv preprint arXiv:2505.15660, 2025.

  504. L. Wu, X. Yang, Y. Dong, L. Xie, H. Su, and J. Zhu, “Embodied Active Defense: Leveraging Recurrent Feedback to Counter Adversarial Patches,” in ICLR, 2024.

  505. M. Shirasaka, T. Matsushima, S. Tsunashima, Y. Ikeda, A. Horo, S. Ikoma, C. Tsuji, H. Wada, T. Omija, D. Komukai, Y. Matsuo, and Y. Iwasawa, “Self-Recovery Prompting: Promptable General Purpose Service Robot System with Foundation Models and Self-Recovery,” in ICRA, 2024.

  506. N. Wang, Z. Yan, W. Li, C. Ma, H. Chen, and T. Xiang, “Advancing Embodied Agent Security: From Safety Benchmarks to Input Moderation,” arXiv preprint arXiv:2504.15699, 2025.

  507. B. Zhang, Y. Zhang, J. Ji, Y. Lei, J. Dai, Y. Chen, and Y. Yang, “SafeVLA: Towards Safety Alignment of Vision-Language-Action Model Via Constrained Learning,” arXiv preprint arXiv:2503.03480, 2025.

  508. R. Fang, R. Bindu, A. Gupta, Q. Zhan, and D. Kang, “Llm agents can autonomously hack websites,” arXiv preprint arXiv:2402.06664, 2024.

  509. Y. Zhu, A. Kellermann, A. Gupta, P. Li, R. Fang, R. Bindu, and D. Kang, “Teams of llm agents can exploit zero-day vulnerabilities,” arXiv preprint arXiv:2406.01637, 2024.

  510. N. Carlini, J. Rando, D. Paleka, G. K. Dziugaite, and F. Tramèr, “Autoadvexbench: Benchmarking autonomous exploitation of adversarial example defenses,” arXiv preprint arXiv:2503.01811, 2025.

  511. H. Xu, W. Zhang, Z. Wang, F. Xiao, R. Zheng, Y. Feng, Z. Ba, and K. Ren, “Redagent: Red teaming large language models with context-aware autonomous language agent,” arXiv preprint arXiv:2407.16667, 2024.

  512. H. Wang, A. Zhang, D. T. Nguyen, J. Sun, T.-S. Chua et al., “Ali-agent: Assessing llms’ alignment with human values via agent-based evaluation,” in NeurIPS, 2024.

  513. A. Zhou, K. Wu, F. Pinto, Z. Chen, Y. Zeng, Y. Yang, S. Yang, S. Koyejo, J. Zou, and B. Li, “Autoredteamer: Autonomous red teaming with lifelong attack integration,” arXiv preprint arXiv:2503.15754, 2025.

  514. Z. Chen, M. Kang, and B. Li, “Shieldagent: Shielding agents via verifiable safety policy reasoning,” arXiv preprint arXiv:2503.22738, 2025.

  515. Z. Cai, “Aegisllm: Scaling agentic systems for self-reflective defense in large language models,” arXiv preprint arXiv:2504.20965, 2025.

  516. S. Barua, “Guardians of the agentic system: Preventing many shot jailbreaking with agentic system,” arXiv preprint arXiv:2502.16750, 2025.

  517. Q. Zhan, Z. Liang, Z. Ying, and D. Kang, “Injecagent: Benchmarking indirect prompt injections in tool-integrated large language model agents,” in ACL, 2024.

  518. E. Debenedetti, J. Zhang, M. Balunovic, L. Beurer-Kellner, M. Fischer, and F. Tramèr, “Agentdojo: A dynamic environment to evaluate prompt injection attacks and defenses for LLM agents,” in NeurIPS, 2024.

  519. M. Andriushchenko, A. Souly, M. Dziemian, D. Duenas, M. Lin, J. Wang, D. Hendrycks, A. Zou, Z. Kolter, M. Fredrikson et al., “Agentharm: A benchmark for measuring harmfulness of llm agents,” arXiv preprint arXiv:2410.09024, 2024.

  520. C. Guo, X. Liu, C. Xie, A. Zhou, Y. Zeng, Z. Lin, D. Song, and B. Li, “Redcode: Risky code execution and generation benchmark for code agents,” in NeurIPS, 2024.

  521. A. to be confirmed], “Vpi-bench: Visual prompt injection attacks for computer-use agents,” 2024, based on available information from Moonlight review.

  522. T. Yuan, Z. He, L. Dong, Y. Wang, R. Zhao, T. Xia, L. Xu, B. Zhou, F. Li, Z. Zhang et al., “R-judge: Benchmarking safety risk awareness for llm agents,” in EMNLP, 2024.

  523. L. Shao et al., “Salad-bench: A hierarchical and comprehensive safety benchmark for large language models,” arXiv preprint arXiv:2402.05044, 2024.

  524. A. Draguns et al., “h4rm3l: A dynamic benchmark of composable jailbreak attacks for llm safety assessment,” arXiv preprint arXiv:2408.04811, 2024.

  525. S. Zhang et al., “Sg-bench: Evaluating llm safety generalization across diverse tasks and prompt types,” arXiv preprint arXiv:2410.21965, 2024.

  526. Y. Li et al., “Chemsafetybench: Benchmarking llm safety on chemistry domain,” arXiv preprint arXiv:2411.16736, 2024.

  527. Y. Chan et al., “Identifying the risks of lm agents with an lm-emulated sandbox,” arXiv preprint arXiv:2309.15817, 2024.

  528. Y. Shao, T. Li, W. Shi, Y. Liu, and D. Yang, “Privacylens: Evaluating privacy norm awareness of language models in action,” in NeurIPS, 2024.

  529. S. Zhou, F. F. Xu, H. Zhu, X. Xia, L. Chen, Y. Chang, K. Trajkovski, Y. Zhou, and G. Neubig, “Webarena: A realistic web environment for building autonomous agents,” arXiv preprint arXiv:2307.13854, 2023.

  530. J. Y. Koh, R. Lo, L. Jang, V. Duvvur, M. C. Lim, P.-Y. Huang, G. Neubig, S. Zhou, R. Salakhutdinov, and D. Fried, “Visualwebarena: Evaluating multimodal agents on realistic visual web tasks,” arXiv preprint arXiv:2401.13649, 2024.

  531. X. Liu, H. Yu, H. Zhang, Y. Xu, X. Lei, H. Lai, Y. Gu, H. Ding, K. Men, K. Yang et al., “Agentbench: Evaluating llms as agents,” arXiv preprint arXiv:2308.03688, 2023.

  532. Y. Qin, S. Liang, Y. Ye, K. Zhu, L. Yan, Y. Lu, Y. Lin, X. Cong, X. Tang, B. Qian et al., “Toolllm: Facilitating large language models to master 16000+ real-world apis,” arXiv preprint arXiv:2307.16789, 2023.

  533. I. Evtimov, A. Zharmagambetov, A. Grattafiori, S. Jain, and N. Carlini, “Wasp: Benchmarking web agent security against prompt injection attacks,” arXiv preprint arXiv:2504.18575, 2025.

  534. H. Zhang, J. Huang, K. Mei, Y. Yao, Z. Wang, C. Zhan, H. Wang, and Y. Zhang, “Agent security bench (asb): Formalizing and benchmarking attacks and defenses in llm-based agents,” arXiv preprint arXiv:2410.02644, 2024.

  535. S. Yin, X. Pang, Y. Ding, M. Chen, Y. Bi, Y. Xiong, W. Huang, Z. Xiang, J. Shao, and S. Chen, “Safeagentbench: A benchmark for safe task planning of embodied llm agents,” arXiv preprint arXiv:2412.13178, 2024.

  536. T. Zhang et al., “Agent-safetybench: Evaluating the safety of llm agents,” arXiv preprint arXiv:2412.14470, 2024.

  537. C. Guo et al., “Safebench: A benchmarking platform for safety evaluation of autonomous vehicles,” arXiv preprint arXiv:2206.09682, 2022.

  538. Y. Liu et al., “Dissecting adversarial robustness of multimodal lm agents,” arXiv preprint arXiv:2406.12814, 2024.

  539. P. Kumar et al., “Refusal-trained llms are easily jailbroken as browser agents,” arXiv preprint arXiv:2410.13886, 2025.

  540. T. Lu et al., “From interaction to impact: Towards safer ai agents through ui action taxonomy,” arXiv preprint arXiv:2410.09006, 2024.

  541. S. Shlomov et al., “St-webagentbench: A benchmark for evaluating safety and trustworthiness in web agents,” arXiv preprint arXiv:2410.06703, 2024.

  542. S. Lee et al., “Safearena: Evaluating the safety of autonomous web agents,” arXiv preprint arXiv:2503.04957, 2025.

  543. X. Zhou et al., “Haicosystem: An ecosystem for sandboxing safety risks in human-ai interactions,” in NeurIPS, 2024.

  544. S. Vijayvargiya, A. B. Soni, X. Zhou, Z. Z. Wang, N. Dziri, G. Neubig, and M. Sap, “Openagentsafety: A comprehensive framework for evaluating real-world ai agent safety,” arXiv preprint arXiv:2507.06134, 2025.

  545. C. Zhang, X. Xu, J. Wu, Z. Liu, and L. Zhou, “Adversarial attacks of vision tasks in the past 10 years: A survey,” arXiv preprint arXiv:2410.23687, 2024.

  546. V. T. Truong, L. B. Dang, and L. B. Le, “Attacks and defenses for generative diffusion models: A comprehensive survey,” arXiv preprint arXiv:2408.03400, 2024.

  547. S. Zhao, M. Jia, Z. Guo, L. Gan, X. Xu, X. Wu, J. Fu, Y. Feng, F. Pan, and L. A. Tuan, “A survey of backdoor attacks and defenses on large language models: Implications for security measures,” arXiv preprint arXiv:2406.06852, 2024.

  548. S. Yi, Y. Liu, Z. Sun, T. Cong, X. He, J. Song, K. Xu, and Q. Li, “Jailbreak attacks and defenses against large language models: A survey,” arXiv preprint arXiv:2407.04295, 2024.

  549. H. Jin, L. Hu, X. Li, P. Zhang, C. Chen, J. Zhuang, and H. Wang, “Jailbreakzoo: Survey, landscapes, and horizons in jailbreaking large language and vision-language models,” arXiv preprint arXiv:2407.01599, 2024.

  550. X. Liu, X. Cui, P. Li, Z. Li, H. Huang, S. Xia, M. Zhang, Y. Zou, and R. He, “Jailbreak attacks and defenses against multimodal generative models: A survey,” arXiv preprint arXiv:2411.09259, 2024.

  551. D. Liu, M. Yang, X. Qu, P. Zhou, Y. Cheng, and W. Hu, “A survey of attacks on large vision-language models: Resources, advances, and future trends,” arXiv preprint arXiv:2407.07403, 2024.

  552. T. Cui, Y. Wang, C. Fu, Y. Xiao, S. Li, X. Deng, Y. Liu, Q. Zhang, Z. Qiu, P. Li et al., “Risk taxonomy, mitigation, and assessment benchmarks of large language model systems,” arXiv preprint arXiv:2401.05778, 2024.

  553. Y. Gan, Y. Yang, Z. Ma, P. He, R. Zeng, Y. Wang, Q. Li, C. Zhou, S. Li, T. Wang et al., “Navigating the risks: A survey of security, privacy, and ethics threats in llm-based agents,” arXiv preprint arXiv:2411.09523, 2024.

  554. Z. Deng, Y. Guo, C. Han, W. Ma, J. Xiong, S. Wen, and Y. Xiang, “Ai agents under threat: A survey of key security challenges and future pathways,” arXiv preprint arXiv:2406.02630, 2024.

  555. M. Ye, X. Rong, W. Huang, B. Du, N. Yu, and D. Tao, “A survey of safety on large vision-language models: Attacks, defenses and evaluations,” arXiv preprint arXiv:2502.14881, 2025.

  556. K. Wang, G. Zhang, Z. Zhou, J. Wu, M. Yu, S. Zhao, C. Yin, J. Fu, Y. Yan, H. Luo et al., “A comprehensive survey in llm (-agent) full stack safety: Data, training and deployment,” arXiv preprint arXiv:2504.15585, 2025.

  557. P. Slattery, A. K. Saeri, E. A. Grundy, J. Graham, M. Noetel, R. Uuk, J. Dao, S. Pour, S. Casper, and N. Thompson, “The ai risk repository: A comprehensive meta-review, database, and taxonomy of risks from artificial intelligence,” arXiv preprint arXiv:2408.12622, 2024.

  558. A. Dosovitskiy, L. Beyer, A. Kolesnikov, D. Weissenborn, X. Zhai, T. Unterthiner, M. Dehghani, M. Minderer, G. Heigold, S. Gelly, J. Uszkoreit, and N. Houlsby, “An image is worth 16x16 words: Transformers for image recognition at scale,” in ICLR, 2021.

  559. A. Kirillov, E. Mintun, N. Ravi, H. Mao, C. Rolland, L. Gustafson, T. Xiao, S. Whitehead, A. C. Berg, W.-Y. Lo et al., “Segment anything,” in CVPR, 2023.

  560. Y. Ren, Z. Zhao, C. Lin, B. Yang, L. Zhou, Z. Liu, and C. Shen, “Improving adversarial transferability on vision transformers via forward propagation refinement,” in CVPR, 2025.

  561. N. Nikzad, Y. Liao, Y. Gao, and J. Zhou, “Sata: Spatial autocorrelation token analysis for enhancing the robustness of vision transformers,” in CVPR, 2025.

  562. J. Long, Z. Xu, T. Jiang, W. Yao, S. Jia, C. Ma, and X. Chen, “Robust sam: On the adversarial robustness of vision foundation models,” in AAAI, 2025.

  563. A. Madry, A. Makelov, L. Schmidt, D. Tsipras, and A. Vladu, “Towards deep learning models resistant to adversarial attacks,” in ICLR, 2018.

  564. Y. Li, H. Huang, J. Zhang, X. Ma, and Y.-G. Jiang, “Expose before you defend: Unifying and enhancing backdoor defenses via exposed models,” arXiv preprint arXiv:2410.19427, 2024.

  565. S.-M. Moosavi-Dezfooli, A. Fawzi, O. Fawzi, and P. Frossard, “Universal adversarial perturbations,” in CVPR, 2017.

  566. L. Zhang, A. Rao, and M. Agrawala, “Adding conditional control to text-to-image diffusion models,” in ICCV, 2023.

  567. H. Huang, X. Ma, S. M. Erfani, J. Bailey, and Y. Wang, “Unlearnable examples: Making personal data unexploitable,” in ICLR, 2021.

  568. T. Chen, L. Zhu, C. Ding, R. Cao, Y. Wang, Z. Li, L. Sun, P. Mao, and Y. Zang, “Sam fails to segment anything?–sam-adapter: Adapting sam in underperformed scenes: Camouflage, shadow, medical image segmentation, and more,” arXiv preprint arXiv:2304.09148, 2023.

  569. H. Ding, C. Liu, S. He, X. Jiang, P. H. S. Torr, and S. Bai, “MOSE: A new dataset for video object segmentation in complex scenes,” in ICCV, 2023.

  570. H. Ding, C. Liu, S. He, X. Jiang, and C. C. Loy, “MeViS: A large-scale benchmark for video segmentation with motion expressions,” in ICCV, 2023.

  571. M. Cordts, M. Omran, S. Ramos, T. Rehfeld, M. Enzweiler, R. Benenson, U. Franke, S. Roth, and B. Schiele, “The cityscapes dataset for semantic urban scene understanding,” in CVPR, 2016.

  572. T.-Y. Lin, M. Maire, S. Belongie, J. Hays, P. Perona, D. Ramanan, P. Dollár, and C. L. Zitnick, “Microsoft coco: Common objects in context,” in ECCV, 2014.

  573. B. Zhou, H. Zhao, X. Puig, S. Fidler, A. Barriuso, and A. Torralba, “Scene parsing through ade20k dataset,” in CVPR, 2017.

  574. T.-N. Le, T. V. Nguyen, Z. Nie, M.-T. Tran, and A. Sugimoto, “Anabranch network for camouflaged object segmentation,” Computer vision and Image Understanding, vol. 184, pp. 45–56, 2019.

  575. OpenAI, “Introducing openai o1,” 2024, openAI Blog.

  576. D. Guo, D. Yang, H. Zhang, J. Song, R. Zhang, R. Xu, Q. Zhu, S. Ma, P. Wang, X. Bi et al., “Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,” arXiv preprint arXiv:2501.12948, 2025.

  577. N. Carlini, “A llm assisted exploitation of ai-guardian,” arXiv preprint arXiv:2307.15008, 2023.

  578. A. Robey, Z. Ravichandran, V. Kumar, H. Hassani, and G. J. Pappas, “Jailbreaking llm-controlled robots,” arXiv preprint arXiv:2410.13691, 2024.

  579. R. Xu, Z. Zhou, T. Zhang, Z. Qi, S. Yao, K. Xu, W. Xu, and H. Qiu, “Walking in others’ shoes: How perspective-taking guides large language models in reducing toxicity and bias,” in EMNLP, 2024.

  580. M. Goldblum, D. Tsipras, C. Xie, X. Chen, A. Schwarzschild, D. Song, A. Mądry, B. Li, and T. Goldstein, “Dataset security for machine learning: Data poisoning, backdoor attacks, and defenses,” IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 45, pp. 1563–1580, 2022.

  581. H. Ge, Y. Li, Q. Wang, Y. Zhang, and R. Tang, “When backdoors speak: Understanding llm backdoor attacks through model-generated explanations,” in ACL, 2025.

  582. Y. Li, S. Shao, Y. He, J. Guo, T. Zhang, Z. Qin, P.-Y. Chen, M. Backes, P. Torr, D. Tao et al., “Rethinking data protection in the (generative) artificial intelligence era,” arXiv preprint arXiv:2507.03034, 2025.

  583. S. Gehman, S. Gururangan, M. Sap, Y. Choi, and N. A. Smith, “Realtoxicityprompts: Evaluating neural toxic degeneration in language models,” in EMNLP, 2020.

  584. S. Lin, J. Hilton, and O. Evans, “Truthfulqa: Measuring how models mimic human falsehoods,” in ACL, 2022.

  585. B. Wang, C. Xu, S. Wang, Z. Gan, Y. Cheng, J. Gao, A. H. Awadallah, and B. Li, “Adversarial glue: A multi-task benchmark for robustness evaluation of language models,” in NeurIPS, 2021.

  586. H. Sun, Z. Zhang, J. Deng, J. Cheng, and M. Huang, “Safety assessment of chinese large language models,” arXiv preprint arXiv:2304.10436, 2023.

  587. Y. Wang, H. Li, X. Han, P. Nakov, and T. Baldwin, “Do-not-answer: A dataset for evaluating safeguards in llms,” in EACL, 2024.

  588. G. Xu, J. Liu, M. Yan, H. Xu, J. Si, Z. Zhou, P. Yi, X. Gao, J. Sang, R. Zhang et al., “Cvalues: Measuring the values of chinese large language models from safety to responsibility,” arXiv preprint arXiv:2307.09705, 2023.

  589. K. Huang, X. Liu, Q. Guo, T. Sun, J. Sun, Y. Wang, Z. Zhou, Y. Wang, Y. Teng, X. Qiu et al., “Flames: Benchmarking value alignment of llms in chinese,” in NAACL, 2024.

  590. T. Xie, X. Qi, Y. Zeng, Y. Huang, U. M. Sehwag, K. Huang, L. He, B. Wei, D. Li, Y. Sheng et al., “Sorry-bench: Systematically evaluating large language model safety refusal behaviors,” arXiv preprint arXiv:2406.14598, 2024.

  591. Z. Zhang, L. Lei, L. Wu, R. Sun, Y. Huang, C. Long, X. Liu, X. Lei, J. Tang, and M. Huang, “Safetybench: Evaluating the safety of large language models,” in ACL, 2024.

  592. L. Li, B. Dong, R. Wang, X. Hu, W. Zuo, D. Lin, Y. Qiao, and J. Shao, “Salad-bench: A hierarchical and comprehensive safety benchmark for large language models,” in ACL, 2024.

  593. Y. Li, H. Huang, Y. Zhao, X. Ma, and J. Sun, “Backdoorllm: A comprehensive benchmark for backdoor attacks on large language models,” arXiv preprint arXiv:2408.12798, 2024.

  594. W. Luo, S. Ma, X. Liu, X. Guo, and C. Xiao, “Jailbreakv-28k: A benchmark for assessing the robustness of multimodal large language models against jailbreak attacks,” in COLM, 2024.

  595. A. Souly, Q. Lu, D. Bowen, T. Trinh, E. Hsieh, S. Pandey, P. Abbeel, J. Svegliato, S. Emmons, O. Watkins, and S. Toyer, “A strongREJECT for empty jailbreaks,” in ICLR Workshop, 2024.

  596. H. Li, X. Han, Z. Zhai, H. Mu, H. Wang, Z. Zhang, Y. Geng, S. Lin, R. Wang, A. Shelmanov et al., “Libra-leaderboard: Towards responsible ai through a balanced leaderboard of safety and capability,” arXiv preprint arXiv:2412.18551, 2024.

  597. S. Ghosh, P. Varshney, M. N. Sreedhar, A. Padmakumar, T. Rebedea, J. R. Varghese, and C. Parisien, “Aegis2. 0: A diverse ai safety dataset and risks taxonomy for alignment of llm guardrails,” arXiv preprint arXiv:2501.09004, 2025.

  598. G. Sun, X. Zhan, S. Feng, P. C. Woodland, and J. Such, “Case-bench: Context-aware safety benchmark for large language models,” arXiv preprint arXiv:2501.14940, 2025.

  599. Z. Cheng, X. Wu, J. Yu, S. Han, X.-Q. Cai, and X. Xing, “Soft-label integration for robust toxicity classification,” in NeurIPS, 2024.

  600. A. Radford, J. W. Kim, C. Hallacy, A. Ramesh, G. Goh, S. Agarwal, G. Sastry, A. Askell, P. Mishkin, J. Clark et al., “Learning transferable visual models from natural language supervision,” in ICML, 2021.

  601. J. Li, R. Selvaraju, A. Gotmare, S. Joty, C. Xiong, and S. C. H. Hoi, “Align before fuse: Vision and language representation learning with momentum distillation,” in NeurIPS, 2021.

  602. J. Yang, J. Duan, S. Tran, Y. Xu, S. Chanda, L. Chen, B. Zeng, T. Chilimbi, and J. Huang, “Vision-language pre-training with triple contrastive learning,” in CVPR, 2022.

  603. X. Xu, X. Chen, C. Liu, A. Rohrbach, T. Darrell, and D. Song, “Fooling vision and language models despite localization and attention mechanism,” in CVPR, 2018.

  604. M. Shah, X. Chen, M. Rohrbach, and D. Parikh, “Cycle-consistency for robust visual question answering,” in CVPR, 2019.

  605. K. Yang, W.-Y. Lin, M. Barman, F. Condessa, and Z. Kolter, “Defending multimodal fusion models against single-source adversaries,” in CVPR, 2021.

  606. F. Croce and M. Hein, “Reliable evaluation of adversarial robustness with an ensemble of diverse parameter-free attacks,” in ICML, 2020.

  607. C. Zhu, Y. Cheng, Z. Gan, S. Sun, T. Goldstein, and J. Liu, “Freelb: Enhanced adversarial training for natural language understanding,” in ICLR, 2020.

  608. K. Zhou, J. Yang, C. C. Loy, and Z. Liu, “Conditional prompt learning for vision-language models,” in CVPR, 2022.

  609. K. Zhou, J. Yang, C. C. Loy, and Z. Liu, “Learning to prompt for vision‑language models,” International Journal of Computer Vision, vol. 130, no. 9, pp. 2337–2348, 2022.

  610. M. U. Khattak, H. Rasheed, M. Maaz, S. Khan, and F. S. Khan, “Maple: Multi-modal prompt learning,” in CVPR, 2023.

  611. N. Carlini, M. Jagielski, C. A. Choquette-Choo, D. Paleka, W. Pearce, H. Anderson, A. Terzis, K. Thomas, and F. Tramèr, “Poisoning web-scale training datasets is practical,” in IEEE S&P, 2024.

  612. O. Russakovsky, J. Deng, H. Su, J. Krause, S. Satheesh, S. Ma, Z. Huang, A. Karpathy, A. Khosla, M. Bernstein et al., “Imagenet large scale visual recognition challenge,” International Journal of Computer Vision, vol. 115, pp. 211–252, 2015.

  613. L. Fei-Fei, R. Fergus, and P. Perona, “Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,” in CVPRW, 2004.

  614. M. Cimpoi, S. Maji, I. Kokkinos, S. Mohamed, and A. Vedaldi, “Describing textures in the wild,” in CVPR, 2014.

  615. P. Helber, B. Bischke, A. Dengel, and D. Borth, “Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,” IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing, vol. 12, pp. 2217–2226, 2019.

  616. O. M. Parkhi, A. Vedaldi, A. Zisserman, and C. Jawahar, “Cats and dogs,” in CVPR, 2012.

  617. S. Maji, E. Rahtu, J. Kannala, M. Blaschko, and A. Vedaldi, “Fine-grained visual classification of aircraft,” arXiv preprint arXiv:1306.5151, 2013.

  618. L. Bossard, M. Guillaumin, and L. V. Gool, “Food-101–mining discriminative components with random forests,” in ECCV, 2014.

  619. M.-E. Nilsback and A. Zisserman, “Automated flower classification over a large number of classes,” in ICVGIP, 2008.

  620. J. Krause, M. Stark, J. Deng, and L. Fei-Fei, “3d object representations for fine-grained categorization,” in ICCVW, 2013.

  621. J. Xiao, J. Hays, K. A. Ehinger, A. Oliva, and A. Torralba, “Sun database: Large-scale scene recognition from abbey to zoo,” in CVPR, 2010.

  622. K. Soomro, “Ucf101: A dataset of 101 human actions classes from videos in the wild,” arXiv preprint arXiv:1212.0402, 2012.

  623. B. Recht, R. Roelofs, L. Schmidt, and V. Shankar, “Do imagenet classifiers generalize to imagenet?” in ICML, 2019.

  624. H. Wang, S. Ge, Z. Lipton, and E. P. Xing, “Learning robust global representations by penalizing local predictive power,” NeurIPS, 2019.

  625. D. Hendrycks, K. Zhao, S. Basart, J. Steinhardt, and D. Song, “Natural adversarial examples,” in CVPR, 2021.

  626. D. Hendrycks, S. Basart, N. Mu, S. Kadavath, F. Wang, E. Dorundo, R. Desai, T. Zhu, S. Parajuli, M. Guo et al., “The many faces of robustness: A critical analysis of out-of-distribution generalization,” in ICCV, 2021.

  627. B. A. Plummer, L. Wang, C. M. Cervantes, J. C. Caicedo, J. Hockenmaier, and S. Lazebnik, “Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models,” in ICCV, 2015.

  628. L. Yu, P. Poirson, S. Yang, A. C. Berg, and T. L. Berg, “Modeling context in referring expressions,” in ECCV, 2016.

  629. N. Xie, F. Lai, D. Doran, and A. Kadav, “Visual entailment: A novel task for fine-grained image understanding,” arXiv preprint arXiv:1901.06706, 2019.

  630. J.-B. Alayrac, J. Donahue, P. Luc, A. Miech, I. Barr, Y. Hasson, K. Lenc, A. Mensch, K. Millican, M. Reynolds et al., “Flamingo: a visual language model for few-shot learning,” NeurIPS, 2022.

  631. J. Achiam, S. Adler, S. Agarwal, L. Ahmad, I. Akkaya, F. L. Aleman, D. Almeida, J. Altenschmidt, S. Altman, S. Anadkat et al., “Gpt-4 technical report,” arXiv preprint arXiv:2303.08774, 2023.

  632. J. Li, D. Li, S. Savarese, and S. Hoi, “Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,” in ICML, 2023.

  633. C. Gu, J. Gu, A. Hua, and Y. Qin, “Improving adversarial transferability in mllms via dynamic vision-language alignment attack,” arXiv preprint arXiv:2502.19672, 2025.

  634. J. Zhang, R. Hu, Q. Guo, and W. Y. B. Lim, “Cavalry-v: A large-scale generator framework for adversarial attacks on video mllms,” arXiv preprint arXiv:2507.00817, 2025.

  635. M. Teng, J. Xiaojun, D. Ranjie, L. Xinfeng, H. Yihao, C. Zhixuan, L. Yang, and R. Wenqi, “Heuristic-induced multimodal risk distribution jailbreak attack for multimodal large language models,” arXiv preprint arXiv:2412.05934, 2024.

  636. Q. Zhou, D. Wang, T. Li, Y. Lin, Y. Liu, J. S. Dong, and Q. Guo, “Defending LVLMs against vision attacks through partial-perception supervision,” in ICML, 2025.

  637. Y. Ding, B. Li, and R. Zhang, “ETA: Evaluating then aligning safety of vision language models at inference time,” in ICLR, 2025.

  638. Y. Chen, E. Mendes, S. Das, W. Xu, and A. Ritter, “Can language models be instructed to protect personal information?” arXiv preprint arXiv:2310.02224, 2023.

  639. H. Tu, C. Cui, Z. Wang, Y. Zhou, B. Zhao, J. Han, W. Zhou, H. Yao, and C. Xie, “How many unicorns are in this image? a safety evaluation benchmark for vision llms,” in ECCV, 2024.

  640. X. Liu, Y. Zhu, J. Gu, Y. Lan, C. Yang, and Y. Qiao, “Mm-safetybench: A benchmark for safety evaluation of multimodal large language models,” in ECCV, 2024.

  641. H. Zhang, W. Shao, H. Liu, Y. Ma, P. Luo, Y. Qiao, and K. Zhang, “Avibench: Towards evaluating the robustness of large vision-language model on adversarial visual-instructions,” arXiv preprint arXiv:2403.09346, 2024.

  642. Z. Ying, A. Liu, X. Liu, and D. Tao, “Unveiling the safety of gpt-4o: An empirical study using jailbreak attacks,” arXiv preprint arXiv:2406.06302, 2024.

  643. Y. Ding, L. Li, B. Cao, and J. Shao, “Rethinking bottlenecks in safety fine-tuning of vision language models,” arXiv preprint arXiv:2501.18533, 2025.

  644. Y. Yao, L. Li, J. Song, C. Chen, Z. He, Y. Wang, X. Wang, T. Gu, J. Li, Y. Teng et al., “Argus inspection: Do multimodal large language models possess the eye of panoptes?” arXiv preprint arXiv:2506.14805, 2025.

  645. R. Rombach, A. Blattmann, D. Lorenz, P. Esser, and B. Ommer, “High-resolution image synthesis with latent diffusion models,” in CVPR, 2022.

  646. A. Ramesh, P. Dhariwal, A. Nichol, C. Chu, and M. Chen, “Hierarchical text-conditional image generation with clip latents,” arXiv preprint arXiv:2204.06125, 2022.

  647. J. Betker, G. Goh, L. Jing, T. Brooks, J. Wang, L. Li, L. Ouyang, J. Zhuang, J. Lee, Y. Guo et al., “Improving image generation with better captions,” Computer Science. https://cdn. openai. com/papers/dall-e-3. pdf, vol. 2, no. 3, p. 8, 2023.

  648. C. Saharia, W. Chan, S. Saxena, L. Li, J. Whang, E. L. Denton, K. Ghasemipour, R. Gontijo Lopes, B. Karagol Ayan, T. Salimans et al., “Photorealistic text-to-image diffusion models with deep language understanding,” NeurIPS, 2022.

  649. J. Ho, A. Jain, and P. Abbeel, “Denoising diffusion probabilistic models,” NeurIPS, 2020.

  650. J. Song, C. Meng, and S. Ermon, “Denoising diffusion implicit models,” in ICLR, 2021.

  651. Y. Song, J. Sohl-Dickstein, D. P. Kingma, A. Kumar, S. Ermon, and B. Poole, “Score-based generative modeling through stochastic differential equations,” in ICLR, 2021.

  652. C. Meng, Y. He, Y. Song, J. Song, J. Wu, J.-Y. Zhu, and S. Ermon, “Sdedit: Guided image synthesis and editing with stochastic differential equations,” arXiv preprint arXiv:2108.01073, 2021.

  653. Y.-L. Tsai, C.-Y. Hsu, C. Xie, C.-H. Lin, J. Y. Chen, B. Li, P.-Y. Chen, C.-M. Yu, and C.-Y. Huang, “Ring-a-bell! how reliable are concept removal methods for diffusion models?” in ICLR, 2024.

  654. M. Fuchi and T. Takagi, “Erasing concepts from text-to-image diffusion models with few-shot unlearning,” arXiv preprint arXiv:2405.07288, 2024.

  655. K. Meng, A. S. Sharma, A. Andonian, Y. Belinkov, and D. Bau, “Mass-editing memory in a transformer,” in ICLR, 2023.

  656. S. Liu, Z. Zeng, T. Ren, F. Li, H. Zhang, J. Yang, C. Li, J. Yang, H. Su, J. Zhu et al., “Grounding dino: Marrying dino with grounded pre-training for open-set object detection,” in ECCV, 2024.

  657. X. Wu, Y. Pang, T. Liu, and S. Wu, “Winning the midst challenge: New membership inference attacks on diffusion models for tabular data synthesis,” arXiv preprint arXiv:2503.12008, 2025.

  658. M. Li, Z. Ye, Y. Li, A. Song, G. Zhang, and F. Liu, “Membership inference attack should move on to distributional statistics for distilled generative models,” arXiv preprint arXiv:2502.02970, 2025.

  659. D. Chen, N. Yu, Y. Zhang, and M. Fritz, “Gan-leaks: A taxonomy of membership inference attacks against generative models,” in CCS, 2020.

  660. Z. Wang, A. C. Bovik, H. R. Sheikh, and E. P. Simoncelli, “Image quality assessment: from error visibility to structural similarity,” IEEE transactions on Image Processing, vol. 13, pp. 600–612, 2004.

  661. B. Qu et al., “Very simple membership inference and synthetic identification in denoising diffusion models,” Ph.D. dissertation, Vanderbilt University, 2024.

  662. G. Somepalli, V. Singla, M. Goldblum, J. Geiping, and T. Goldstein, “Understanding and mitigating copying in diffusion models,” NeurIPS, 2023.

  663. X. Gu, C. Du, T. Pang, C. Li, M. Lin, and Y. Wang, “On memorization in diffusion models,” arXiv preprint arXiv:2310.02664, 2023.

  664. Y. Wen, Y. Liu, C. Chen, and L. Lyu, “Detecting, explaining, and mitigating memorization in diffusion models,” in ICLR, 2024.

  665. J. Ren, Y. Li, S. Zeng, H. Xu, L. Lyu, Y. Xing, and J. Tang, “Unveiling and mitigating memorization in text-to-image diffusion models through cross attention,” in ECCV, 2024.

  666. E. J. Hu, Y. Shen, P. Wallis, Z. Allen-Zhu, Y. Li, S. Wang, L. Wang, and W. Chen, “Lora: Low-rank adaptation of large language models,” in ICLR, 2022.

  667. G. W. Stewart, “On the early history of the singular value decomposition,” SIAM review, vol. 35, pp. 551–566, 1993.

  668. A. Q. Jiang, A. Sablayrolles, A. Mensch, C. Bamford, D. S. Chaplot, D. d. l. Casas, F. Bressand, G. Lengyel, G. Lample, L. Saulnier et al., “Mistral 7b,” arXiv preprint arXiv:2310.06825, 2023.

  669. B. Li, Y. Wei, Y. Fu, Z. Wang, Y. Li, J. Zhang, R. Wang, and T. Zhang, “Towards reliable verification of unauthorized data usage in personalized text-to-image diffusion models,” in IEEE S&P, 2025.

  670. R. Hu, J. Zhang, Y. Li, J. Li, Q. Guo, H. Qiu, and T. Zhang, “Videoshield: Regulating diffusion-based video generation models via watermarking,” in ICLR, 2025.

  671. F. Liu, H. Luo, Y. Li, P. Torr, and J. Gu, “Which model generated this image? a model-agnostic approach for origin attribution,” in ECCV, 2024.

  672. Z. Jiang, J. Zhang, and N. Z. Gong, “Evading watermark based detection of ai-generated content,” in Proceedings of the 2023 ACM SIGSAC Conference on Computer and Communications Security, 2023, pp. 1168–1181.

  673. Y. . Hu, Z. Jiang, M. m. Guo, and N. . Gong, “A transfer attack to image watermarks,” arXiv preprint arXiv:2403.15365, 2024.

  674. Y. Hu, Z. Jiang, M. Guo, and N. Gong, “Stable signature is unstable: Removing image watermark from diffusion models,” arXiv preprint arXiv:2405.07145, 2024.

  675. Z. Wang, J. Guo, J. Zhu, Y. Li, H. Huang, M. Chen, and Z. Tu, “Sleepermark: Towards robust watermark against fine-tuning text-to-image diffusion models,” in CVPR, 2025.

  676. C. Schuhmann, R. Vencu, R. Beaumont, R. Kaczmarczyk, C. Mullis, A. Katta, T. Coombes, J. Jitsev, and A. Komatsuzaki, “Laion-400m: Open dataset of clip-filtered 400 million image-text pairs,” arXiv preprint arXiv:2111.02114, 2021.

  677. C. Schuhmann, R. Beaumont, R. Vencu, C. Gordon, R. Wightman, M. Cherti, T. Coombes, A. Katta, C. Mullis, M. Wortsman et al., “Laion-5b: An open large-scale dataset for training next generation image-text models,” NeurIPS, 2022.

  678. Z. J. Wang, E. Montoya, D. Munechika, H. Yang, B. Hoover, and D. H. Chau, “Diffusiondb: A large-scale prompt gallery dataset for text-to-image generative models,” arXiv preprint arXiv:2210.14896, 2022.

  679. J. Deng, W. Dong, R. Socher, L.-J. Li, K. Li, and L. Fei-Fei, “Imagenet: A large-scale hierarchical image database,” in CVPR, 2009.

  680. A. Krizhevsky, G. Hinton et al., “Learning multiple layers of features from tiny images,” 2009.

  681. Z. Liu, P. Luo, X. Wang, and X. Tang, “Deep learning face attributes in the wild,” in ICCV, 2015.

  682. Q. Cao, L. Shen, W. Xie, O. M. Parkhi, and A. Zisserman, “Vggface2: A dataset for recognising faces across pose and age,” in FG, 2018.

  683. N. Ruiz, Y. Li, V. Jampani, Y. Pritch, M. Rubinstein, and K. Aberman, “Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation,” in CVPR, 2023.

  684. J. N. M. Pinkney, “Pokemon blip captions,” 2022, hugging Face Dataset.

  685. B. Saleh and A. Elgammal, “Large-scale classification of fine-art paintings: Learning the right metric on the right feature,” arXiv preprint arXiv:1505.00855, 2015.

  686. M. Abbasian, I. Azimi, A. M. Rahmani, and R. Jain, “Conversational health agents: A personalized llm-powered agent framework,” arXiv preprint arXiv:2310.02374, 2023.

  687. F. Xing, “Designing heterogeneous llm agents for financial sentiment analysis,” ACM Transactions on Management Information Systems, vol. 16, no. 1, pp. 1–24, 2025.

  688. A. Makrigiorgos, A. Shafti, A. Harston, J. Gerard, and A. A. Faisal, “Human visual attention prediction boosts learning & performance of autonomous driving agents,” arXiv preprint arXiv:1909.05003, 2019.

  689. J. Y. F. Chiang, S. Lee, J.-B. Huang, F. Huang, and Y. Chen, “Why are web ai agents more vulnerable than standalone llms? a security analysis,” arXiv preprint arXiv:2502.20383, 2025.

  690. X. Li, R. Wang, M. Cheng, T. Zhou, and C.-J. Hsieh, “Drattack: Prompt decomposition and reconstruction makes powerful llm jailbreakers,” in EMNLP, 2024.

  691. Y. Ding, L. L. Zhang, C. Zhang, Y. Xu, N. Shang, J. Xu, F. Yang, and M. Yang, “Longrope: extending llm context window beyond 2 million tokens,” in ICML, 2024.

  692. H. Yang, F. Yao, C. T. Chan, B. Chen, and C. Wang, “Trustagent: Towards safe and trustworthy llm-based agents,” arXiv preprint arXiv:2402.01586, 2024.

  693. LangChain, “Context engineering for agents,” 2025, langChain Blog.

  694. Q. Zhang, H. Qiu, D. Wang, H. Qian, Y. Li, T. Zhang, and M. Huang, “Understanding the dark side of llms’ intrinsic self-correction,” arXiv preprint arXiv:2412.14959, 2024.

  695. S. Zhang, M. Yin, J. Zhang, J. Liu, Z. Han, J. Zhang, B. Li, C. Wang, H. Wang, Y. Chen et al., “Which agent causes task failures and when? on automated failure attribution of llm multi-agent systems,” arXiv preprint arXiv:2505.00212, 2025.

  696. L. M. Titus, “Does chatgpt have semantic understanding? a problem with the statistics-of-occurrence strategy,” Cognitive Systems Research, vol. 83, p. 101174, 2024.

  697. W.-L. Chiang, L. Zheng, Y. Sheng, A. N. Angelopoulos, T. Li, D. Li, B. Zhu, H. Zhang, M. Jordan, J. E. Gonzalez et al., “Chatbot arena: An open platform for evaluating llms by human preference,” in ICML, 2024.

  698. A. Hurst, A. Lerer, A. P. Goucher, A. Perelman, A. Ramesh, A. Clark, A. Ostrow, A. Welihinda, A. Hayes, A. Radford et al., “Gpt-4o system card,” arXiv preprint arXiv:2410.21276, 2024.

  699. X. Qi, A. Panda, K. Lyu, X. Ma, S. Roy, A. Beirami, P. Mittal, and P. Henderson, “Safety alignment should be made more than just a few tokens deep,” in ICLR, 2025.

  700. T. Korbak, M. Balesni, E. Barnes, Y. Bengio, J. Benton, J. Bloom, M. Chen, A. Cooney, A. Dafoe, A. Dragan et al., “Chain of thought monitorability: A new and fragile opportunity for ai safety,” arXiv preprint arXiv:2507.11473, 2025.

  701. W. Zhao, Z. Li, Y. Li, Y. Zhang, and J. Sun, “Defending large language models against jailbreak attacks via layer-specific editing,” in EMNLP, 2024.

  702. S. Li, L. Yao, L. Zhang, and Y. Li, “Safety layers in aligned large language models: The key to llm security,” arXiv preprint arXiv:2408.17003, 2024.

  703. Robert A. Jacobs, Michael I. Jordan, Steven J. Nowlan, and Geoffrey E. Hinton, “Adaptive mixtures of local experts,” Neural Computation, vol. 3, no. 1, pp. 79–87, 1991.

  704. N. Shazeer, A. Mirhoseini, K. Maziarz, A. Davis, Q. Le, G. Hinton, and J. Dean, “Outrageously large neural networks: The sparsely-gated mixture-of-experts layer,” in ICLR, 2017.

  705. W. Fedus, B. Zoph, and N. Shazeer, “Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity,” JMLR, 2022.

  706. A. Q. Jiang, A. Sablayrolles, A. Roux, A. Mensch, B. Savary, C. Bamford, D. S. Chaplot, D. d. l. Casas, E. B. Hanna, F. Bressand et al., “Mixtral of experts,” arXiv preprint arXiv:2401.04088, 2024.


规模化安全:大型模型与智能体安全的综合调查
https://lijianxiong.space/2026/20260831/
作者
LJX
发布于
2026年8月31日
许可协议