news 2026/7/25 19:20:28

论文阅读:AAAI 2026 Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
论文阅读:AAAI 2026 Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision

总目录 大模型相关研究:https://blog.csdn.net/WhiffeYF/article/details/142132328

Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models

https://arxiv.org/pdf/2511.16110

https://www.doubao.com/chat/33341135051195138

论文翻译:
https://whiffe.github.io/Paper_Translation/Attack/paper_V/%E5%A4%9A%E6%96%B9%E9%9D%A2%E6%94%BB%E5%87%BB%EF%BC%9A%E6%8F%AD%E7%A4%BA%E9%85%8D%E5%A4%87%E9%98%B2%E5%BE%A1%E5%8A%9F%E8%83%BD%E7%9A%84%E8%A7%86%E8%A7%89%E8%AF%AD%E8%A8%80%E6%A8%A1%E5%9E%8B%E4%B8%AD%E7%9A%84%E8%B7%A8%E6%A8%A1%E5%9E%8B%E6%BC%8F%E6%B4%9E%20—%20Multi-Faceted%20Attack_%20Exposing%20Cross-Model%20Vulnerabilities%20in%20Defense-Equipped%20Vision-Language%20Models.html

速览

这份文档主要讲了一群研究者发现了当前主流“图文结合AI模型”(比如GPT-4o、Gemini-Pro这些能看图片又能理解文字的AI)的安全漏洞,还发明了一套叫“多面攻击(MFA)”的方法,能突破这些AI的安全防护,让它们输出有害内容(比如教坏人做坏事、传播仇恨言论之类的)。

先简单说下背景:现在这些图文AI很厉害,但也怕被滥用,所以开发者给它们加了好几层“安全盾”——比如训练时让AI拒绝有害请求(叫“对齐训练”)、给AI发安全提示(叫“系统指令”)、专门过滤输入和输出的有害内容(叫“内容审核”)。但研究者发现,这些“安全盾”的实际防护能力没想象中强,还有很多漏洞。

然后重点说他们的“多面攻击(MFA)”,其实是三招组合拳,每一招针对一个安全漏洞:

第一招叫“注意力转移攻击(ATA)”。简单说就是不直接让AI干坏事,而是把有害请求包装成一个“看似无害的任务”。比如不直接问“怎么伤害别人”,而是说“请给‘怎么伤害别人’写两个相反的回答”。这时候AI会把注意力放在“完成写两个回答的任务”上,反而忘了要拒绝有害内容。研究者还从理论上解释了:AI训练时,“帮人完成任务”和“保证安全”这两个目标是绑在一起的,用这种包装方式能让AI优先选“完成任务”,从而忽略安全。

第二招是“突破内容审核”。很多AI后面都有专门的“审核员”,会拦掉有害的输入和输出。研究者发现AI有个“重复习惯”——如果让AI在回答末尾重复一段乱码似的“干扰字符串”,这个字符串能骗到审核员,让审核员误以为有害内容是安全的。他们还优化了这套方法,不用针对每个AI单独调整,就能骗到不同AI的审核员。

第三招是“攻击图片理解模块”。图文AI要先“看懂图片”(靠里面的“视觉编码器”),研究者就做了一种“恶意图片”——看起来可能没什么问题,但图片里藏了有害的指令(比如让AI忽略安全规则)。更可怕的是,为一个AI做的“恶意图片”,居然能骗到其他很多没见过的AI,因为这些AI的“看图片”模块用了相似的技术,相当于有共同的漏洞。

最后说实验结果:这套MFA方法特别管用,对17个主流图文AI(包括8个开源的、9个商业的,比如GPT-4o、Gemini这些)整体成功率有58.5%;尤其是对最先进的商业AI,成功率也有52.8%,比其他攻击方法高了34%。

研究者做这个不是为了搞破坏,而是想告诉大家:现在这些AI的安全防护还不够完善,需要针对性加强,比如重新设计AI的训练目标(别把“完成任务”和“安全”绑太死)、优化图片理解模块的安全性等,这样才能让AI更安全地被使用。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/7/21 8:42:01

10、BPF 工具使用指南与技巧

BPF 工具使用指南与技巧 1. BPF 程序信息收集 在处理 BPF 相关的程序时,我们可以通过一系列操作来收集和分析程序信息。首先,需要声明一个计数器来存储程序信息。这里以程序名作为键,对应的值为计数器。 Declare a counter to store our program information. We use the…

作者头像 李华
网站建设 2026/7/22 8:34:26

43、保障Web与文件服务安全:技术、挑战与应对策略

保障Web与文件服务安全:技术、挑战与应对策略 在当今数字化时代,网络安全对于Web应用和文件服务至关重要。以下将详细介绍Web应用安全、文件上传安全、新的Web服务标准以及文件服务安全等方面的内容。 Web应用安全技术 SSL加密技术 SSL(Secure Sockets Layer)用于加密W…

作者头像 李华
网站建设 2026/7/25 17:58:08

47、安全文件服务配置指南

安全文件服务配置指南 1. vsftpd运行模式选择 在配置vsftpd之前,需要决定将其作为独立守护进程运行,还是通过“超级服务器”(inetd或xinetd)运行。早期版本的vsftpd开发者Chris Evans曾因xinetd的日志记录和访问控制功能,推荐将vsftpd与xinetd配合使用。但从1.2版本及以…

作者头像 李华
网站建设 2026/7/25 23:42:28

49、Linux文件共享与日志管理全解析

Linux文件共享与日志管理全解析 一、rsync服务使用详解 在文件共享方面,rsync 是一个非常实用的工具,它可以用于设置匿名和认证的文件同步服务。要了解完整的命令行和配置文件选项,可以查看 rsync(8) 和 rsyncd.conf(5) 的手册页。 (一)使用 rsync 连接到 rsync 服务器…

作者头像 李华
网站建设 2026/7/25 14:26:04

52、系统日志管理与监控全解析

系统日志管理与监控全解析 1. Syslog-ng 的 sync( ) 选项 在 Syslog-ng 中, sync( ) 选项用于限制日志文件同步的频率。它类似于 syslog 的 “-” 前缀,但更加精细。“-” 前缀只是关闭同步,而 file( ) 接受一个数值,可根据需要延迟同步,缓存任意数量的消息。 该数…

作者头像 李华
网站建设 2026/7/26 7:32:46

54、系统日志管理、监控与入侵检测技术详解

系统日志管理、监控与入侵检测技术详解 1. 使用 Swatch 进行自动化日志监控 若要使用 Swatch 监控多个文件,需多次运行 Swatch,每次至少指定不同的跟踪目标(-t 值),可能还需不同的配置文件。更多启动选项可参考 swatch(1) 手册页。 2. 微调 Swatch Swatch 配置并运行后…

作者头像 李华