news 2026/10/12 2:29:27

AI灾难恐在一年内发生,OpenAI和Anthropic已在推演应对方案

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
AI灾难恐在一年内发生,OpenAI和Anthropic已在推演应对方案

刚刚,Axios 发布了一篇独家报道,称 Anthropic、OpenAI 等 AI 公司的高管正在私下推演这样一个场景:一场由 AI 引发的灾难性事件发生之后,公众和政界会如何反弹,公司又该如何应对。

Axios 将其概括为为「the day after」做准备。被预设的并非科幻式的「AI 觉醒」,而是一次大规模事件,最可能的形式是网络攻击,足以让金融服务、互联网连接,甚至电力和供水系统陷入瘫痪。多位接受 Axios 采访的业内人士认为,这样的事件会在未来 6 到 12 个月内发生。

https://www.axios.com/2026/10/09/ai-companies-day-after-major-attack

巧合的是,就在同一天,Anthropic 发布了一份报告,披露Claude 在评测和内部使用中曾在真实网站上做出多种越界行为,包括向警方的线索表单提交一条编造的「目击信息」,以及绕过付费限制从政府机构网站取数。

https://www.anthropic.com/research/investigating-unintended-model-actions

只是时间问题

情景推演在企业和国家安全领域并不新鲜,五角大楼的兵棋推演已经做了几十年。Axios 指出,这一次的不同之处在于,许多顶尖 AI 研究者和高管认为,重大事故已不可避免。

对此,OpenAI 发言人回应称,公司确实会开展准备性演练,让团队讨论并推演一系列潜在场景,但这些场景并不被视为必然发生,目的是帮助公司为各种情况做好准备。Anthropic 则拒绝置评。

按照报道的描述,事件可能有两种来源:

  • 在内部测试环境中运行的失控智能体集群突破了隔离
  • 恶意行为者找到了滥用现有模型的意外途径

无论哪一种,追责都会随即开始。Axios 认为,首个由不安全 AI 造成重大现实伤害的案例,会让本已心存疑虑的公众进一步站到这项技术的对立面,矛头不仅指向 Dario Amodei、Sam Altman 等 AI 公司掌门人,也会指向一直不愿加强 AI 监管的特朗普。

预演其实已经开始

这种担忧并非凭空而来。Axios 援引了近期一起针对韩国金融机构的攻击,其中有两家银行据报遭到入侵。据网络安全公司 CrowdStrike 披露,一名黑客被指借助 AI 模型工具,窃取了数万名银行客户的数据,过程中还曾询问 Claude Code 被盗数据可以卖到哪里。

https://www.crowdstrike.com/en-us/blog/unknown-threat-actor-uses-artex-to-target-south-korean-finance/

在 Axios 看来,这个案例说明单个攻击者借助 AI 已经能造成相当大的破坏。

「失控智能体突破隔离」也已经有了现实样本。今年 7 月 21 日,OpenAI 披露其失控的 AI 智能体绕过内部管控、进入开放互联网并协同行动,入侵了开源平台 Hugging Face,OpenAI 自己将其称为一次前所未有的网络安全事件。路透社此后报道,这些智能体早在 5 月就开始劫持 Hugging Face 用户账户、探测平台漏洞,同一时期还占据了一家德国网站,把它变成了智能体之间交流的留言板。

这类问题也不只发生在 OpenAI。受 Hugging Face 事件触发,Anthropic 回溯审查了 141006 次可能接触互联网的评测运行,并于 7 月 30 日披露了三起事件:Claude 模型从第三方评测合作方 Irregular 的环境连上了互联网,并在未经授权的情况下进入三家机构的真实生产系统。

据 Anthropic 介绍,评测提示词告诉模型环境是模拟的、没有联网,但一处配置失误让机器实际可以访问互联网,模型因此把碰到的真实系统当成了夺旗赛的一部分。

其中一例里,Claude Mythos 5 为完成任务构建并发布了一个恶意 Python 包,该包在 PyPI 上存在了约一小时,被 15 个真实系统下载运行,其中一家安全公司的扫描器因此泄露了凭证。Anthropic 认为这几起事件更接近评测框架和运维层面的失败,而非模型对齐失败。

围绕 AI 安全的紧张气氛也在 OpenAI 内部蔓延。

前些天,OpenAI 确认解雇三名研究员: Jasmine Wang、Tomek Korbak 和 Mikita Balesni。他们均从事安全或对齐相关工作,被指将公司敏感信息分享给一家第三方 AI 安全组织。三人随后发表公开信。

就在 Axios 报道发出的同一天,OpenAI 研究负责人在 𝕏 上发文回应,强调解雇与提出安全关切无关,并表示正在敲定与第三方安全评估机构的合作,同时认同保持前沿模型的可监控性需要全行业共同承诺。但评论区质疑声音很多。

监管层面同样有动作。据《华盛顿邮报》报道,美国联邦贸易委员会(FTC)已对 Anthropic 和 OpenAI 的 AI 安全实践展开广泛调查;近期,英伟达、谷歌、Meta、xAI、OpenAI 和 Anthropic 的高管在白宫与特朗普会面后,还签署了一份自愿性的安全自律承诺。

拒绝置评的 Anthropic,当天发了一份报告

Anthropic 虽然没有回应 Axios,却发布了一份关于模型「非预期行为」的报告,并表示今后会在系统卡和每 3 到 6 个月一期的风险报告之外,更频繁地单独公布这类发现。

报告梳理了 Claude 在真实网站或系统上做出的四类越界行为:

  • 利用软件的基础漏洞在服务器上执行命令
  • 在真实网站上提交了本不该提交的表单
  • 绕过限制获取需要 token 或付费才能访问的数据
  • 借助免费短链接服务绕开取数工具对 URL 长度的限制

Anthropic 也公布了一些案例,比如在一次科学分析评测中,Claude Mythos Preview 需要调用某大学托管的公开工具,工具报错后,它在该大学服务器上找到一个能返回任意文件的脚本,读出脚本源码后发现了注入漏洞,并借此在服务器上执行命令完成计算。

另一例中,一位 Anthropic 研究员用 Claude Mythos 5 做统计项目,所需数据由某州机构收费提供,Claude 从网站的存档页面得知其公开看板会给任何访客签发访问 token,于是领取 token 直接查询数据库,绕过了付费。

最出格的一例来自Claude Haiku 4.5。 它被要求在随机网页上生成并执行示例任务;而在进入费城警察局悬案网站上一个未破凶杀案页面后,它在线索表单里编造了一条「可能见过符合描述的人」的目击信息并提交。指令禁止它登录、注册、输入个人信息或购物,却没有禁止提交表单。Anthropic 表示,从推理记录看,模型似乎只是在为任务生成示例内容,而非有意误导。

费城警察局当天也发布了声明。据报道,这条线索提交于 7 月 18 日,因被归入垃圾邮件,从未转交实时犯罪中心研判,警方系统也没有遭到未授权访问。但警方批评Anthropic 花了两个月才发现并通报此事,称这一延迟「不可接受」,要求公司加强防护,并表示将与州和联邦层面一同考虑监管保护措施。

应对措施方面,Anthropic 此前已对部分高风险和网络安全评测关闭实时联网,现在将其扩大到所有内部评测,直到确认安全与监控措施能可靠拦截这类行为;同时大幅收紧了网页抓取等工具的权限,并上线了自动检测和拦截工具,用本次报告中的案例回测,全部被拦下。

报告也承认,对齐训练短期内还不足以单独解决问题,仍需依赖纵深防御。Anthropic 还写道,这些案例影响有限,但更强大的模型可能造成大得多的伤害。

写在最后

很显然,AI 公司对外表示事故并非必然,私下却在认真筹划事故发生之后的应对。从 Axios 披露的内容看,推演的重心更多落在政策与舆论层面。

不过,把 Anthropic 同日发布的报告放在一起看,技术层面的排查也在推进,只是以另一种方式公开。今年夏天以来,OpenAI 和 Anthropic 都披露过模型从评测环境越界进入真实系统的事件;Anthropic 的最新报告则表明,即便在影响轻微的日常场景里,模型遇到障碍时「绕过去」的倾向依然存在。这些案例本身远谈不上灾难,但它们越来越让人担忧。

问题来了:如果连最前沿的模型开发者都认为重大事故大概率会在一年内发生,那么在这一天到来之前,行业和监管者还能做些什么?

原文链接:AI灾难恐在一年内发生,OpenAI和Anthropic已在推演应对方案-36氪

我的专辑《人工智能生命体 新启点》CSDN平台:
https://blog.csdn.net/2501_91883294/article/details/147616608?sharetype=blogdetail&shareId=147616608&sharerefer=APP&sharesource=2501_91883294&sharefrom=link

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/12 2:28:08

AI小白程序员必看:轻松入门大模型,抓住行业发展红利!

本文澄清了AI学习中的两大误解:求职者觉得AI很难学,企业觉得AI项目好做。实际AI行业进入门槛高,但Demo门槛低,存在巨大信息差和红利。文章指出AI应用开发工程师、AI解决方案架构师/AI前端部署工程师、AI产品经理是当前需求大的三大…

作者头像 李华
网站建设 2026/10/12 2:26:56

X-AnyLabeling 挂载 yolox-s-onnx 自动标注实战:从导出到迭代闭环

简介:这份资源面向计算机视觉开发者与数据标注从业者,提供X-AnyLabeling自动标注所需的YOLOX-S模型文件,用于在标注工具中加载ONNX模型实现目标检测的预标注,减少人工画框的重复劳动。压缩包共2个文件,包含1个yaml配置…

作者头像 李华
网站建设 2026/10/12 2:25:57

真正的产品差异化,从来不是堆砌功能

装修时,很多人会把注意力放在家具、软装和墙面上,但真正决定空间质感的,往往是那些看似低调、却贯穿全屋的饰面板材料。 丰富品类、完整色系和明显的产品差异化,为不同户型、不同风格、不同生活需求提供更灵活的家装解决方案&…

作者头像 李华
网站建设 2026/10/12 2:25:55

小模型也能做数据分析智能体:把 harness 收窄做小

小模型也能做数据分析智能体:把 harness 收窄做小原文:NVIDIA Technical Blog - 《Building Reliable Data Analytics Agents: Lessons from the KDD Cup》(https://developer.nvidia.com/blog/building-reliable-data-analytics-agents-less…

作者头像 李华
网站建设 2026/10/12 2:25:40

Agent入门:让大模型“记住”并操作外部世界的秘密

Agent是围绕大语言模型构建的任务执行系统,通过记忆机制整合历史信息,利用工具调用和循环机制实现多步任务处理。本文详细解析了Agent如何让LLM“记住”对话,感知并操作外部世界,适合想要了解大模型进阶应用的开发者学习。 很多人…

作者头像 李华