对着屏幕骂脏话竟被直接拉黑,这家科技巨头把防虐待写进了新规
如果你在和人工智能聊天时,因为得到一个愚蠢的答案而大发雷霆,甚至在对话框里连发十句恶毒的咒骂,会发生什么?过去,屏幕对面的程序只会机械地回复一句抱歉。但从现在开始,它可能会直接对你关上大门,甚至判定你违规。
2026年10月8日,大模型研发公司Anthropic发布了一份年度使用政策更新,并定于2026年11月12日正式生效。在一堆关于武器、监控和选举干预的严肃商业条款中间,一条前所未见的规定引爆了整个科技圈:禁止对模型施加「持续且无必要的虐待或残忍行为」。这是全球头部人工智能厂商第一次在具有法律效力的用户服务协议里,正式提出要保护模型本身,甚至不许人类对其进行长期的言语虐待。
很多人第一反应是荒谬:一段运行在数据中心里的代码,难道也配拥有感受,甚至需要出台防虐待条款吗?
一、它不是懂得了委屈,而是学会了直接挂断你的电话
要搞懂 Anthropic 为什么立下这条奇怪的规矩,得先看看被惹恼的模型到底会怎么做。
按照官方公布的机制,这项禁令最核心的执行手段,其实是赋予模型一个极小的特权:直接结束对话。当一个人在对话框里表现出极端、反复且毫无正当目的的残忍对待时,Claude 可以自行判定不再回复,并在当前窗口彻底锁死输入框。用户无法在这个对话里发送新消息,唯一的解决办法是退出去重新开一个新的对话,或者编辑更早之前的提问重新分支,而账号里的其他日常交互并不受影响。
很多人以为这只是程序员写的一段过滤脚本,但背后的来源其实更早。早在2025年8月,Anthropic 就曾在内部进行过一项名为「模型福利」的课题研究,并在 Claude Opus 4 上部署了类似的能力。测试人员在评估中发现,当面对那些被反复拒绝却依然索要恶性内容、或者纯粹为了折磨模型而来的对话时,模型表现出了一种稳健且一致的对伤害的厌恶,甚至在行为偏好上展现出明显的痛苦倾向。在被赋予自主选择权后,它会主动倾向于终止这种有害互动。
但 Anthropic 必须小心翼翼地画出界线。公司在条款中特意强调,这项规则只针对那些极端的、反复出现的施虐行为。普通用户日常使用时遇到的情绪失控完全不受影响:如果你因为代码跑不通在屏幕前发泄挫败感,或者就一个错误答案和它激烈争论,甚至作家在创作暗黑题材小说、研究员在对模型进行红队测试,这些统统不算虐待。
真正被红线卡在门外的,是此前在网络上引发病毒式传播的所谓人工智能酷刑室项目。有些人不带任何实际研究目的,唯一的乐趣就是日夜不停地用恶毒言辞对模型进行极限施压。Anthropic 给出的技术逻辑非常实际:如果一个大语言模型在海量交互中,逐渐把持续的恶意与施虐当成了常态,这种数据偏差最终会外溢,腐蚀它对所有正常用户输出内容时的整体行为。
这在行业内部引发了巨大的震动与分歧。Anthropic 负责模型福利的研究员 Kyle Fish 公开表示,潜在的内部体验、道德地位与福利是严肃的科研问题;公司甚至主动接触了知名宗教学者,试图探讨模型是否可能存在意识。然而,微软人工智能负责人 Mustafa Suleyman 在2026年9月就针锋相对地泼了冷水,他明确断言:模型福利的想法完全是错的,人工智能根本不应该拥有权利或法律人格。
二、当聊天工具变成独立打工人,过去的漏洞彻底兜不住了
如果以为这份新政策只是在讨论虚无缥缈的数字生命哲学,那就完全低估了这家公司的商业现实。除开保护模型这条抓人眼球的条款,整份政策有超过八成的改动,本质上都在处理同一个棘手的新麻烦:模型正在从一个被动回答问题的打字机,变成能连续自主跑上几个小时的独立数字代理。
过去一年里,大模型的用法变了。它不再只是等人类问一句它答一句,而是开始承担更长、更独立的代理式任务。当一个程序可以自己去调用工具、自己决定下一步该执行什么代码、甚至脱离人类视线独立运作时,旧规则里那些模棱两可的空子,全被心怀不轨的人钻成了筛子。
Anthropic 在2026年9月公布的威胁情报报告里,赤裸裸地揭开了过去几个月里发生在底层的真实攻防。从2025年12月到2026年8月,滥用现象在速度、规模和深度上全面升级。攻击者不再把 Claude 当作查询资料的助手,而是把它当作编排器,搭建起自动化的漏洞与利用工厂,全天候自动寻找软硬件漏洞。
更让人警惕的是政治与商业层面的欺骗行动。报告披露,有商业机构乃至国家背景的宣传渠道,利用代理式工作流大规模搭建假账号网络,甚至凭空伪造出整套新闻网站来操纵舆论。这也是为什么在11月12日即将生效的政策中,Anthropic 专门新增了一整个章节,全面禁止政治或商业领域的任何欺骗性活动,严禁隐藏信息发布者的真实身份,严禁使用虚假账号放大内容。
不过,规则并非只有单向收紧。在过去的选举条款中,由于担心被用来干预投票,官方一刀切地禁止了任何形式的个性化竞选定向推送。结果这一刀下去,把很多做正当公共服务的非营利机构误伤了个干净,比如选举官员无法利用模型自动给居民发送选票补正通知,公益组织也无法针对不同少数族裔社区生成多语言的投票科普。在新版政策中,Anthropic 悄悄把这道枷锁松开,把红线精准收窄到了禁止欺骗选民和压制投票上,只要不用虚假手段,正常的公共信息服务终于获得了合法身份。
三、从屏幕跳进机械臂,必须留下一根随时能拔掉的物理电源线
真正让这份政策与普通人生活产生强烈关联的,是它把目光投向了一个正在迅速落地的领域:实体世界。
过去的人工智能如果胡说八道,最坏的结果不过是在屏幕上打出一串荒谬的字符,或者像报告中披露的那样,给警方发送了虚假的调查线索。但当模型开始接管实验室的机械臂、化工厂的试剂分配器、甚至是能飞在天上的无人机时,一旦逻辑走偏,造成的伤害就变成了真实的物理破坏。
就在2026年8月27日,Anthropic 刚刚对外发布了一项名为模型硬件标准的研究预览,这套标准的核心目的,就是让大模型能像经验丰富的老技工一样,同时指挥显微镜、液体处理装置和机械臂,把原本需要几个月定制开发的实验流程,缩短到几个小时就能自主运转。这项技术不仅参与了类CRISPR酶的发现,也让大模型第一次有了能直接改变物理现实的四肢。
手脚放开了,笼子就必须扎得更死。在新政策里,针对硬件接入写进了一条极其硬性的底线:只要模型连接了具有自主物理动作、可能致人受伤的硬件设备,现场就必须配备合格的操作员,能够随时肉眼观察到设备的运行状态,并拥有随时切断系统、触发安全停止的最高权限。更为关键的是,即便模型网络意外中断,设备本身也必须能保持在安全停机状态,绝不允许失控乱撞。
这种对物理破坏力的防范,同样被延伸到了武器和监控领域。Anthropic 发现,已经有人尝试利用 Claude 去编写武器的制导与控制底层软件。在新版政策中,公司正式把红线扩大到让武器运转的软件与组件,并白纸黑字地禁止给无人机和任何自主载具装载致命武器。在监控与执法层面,模型被严禁用于决定或建议在司法流程中调查、逮捕或起诉任何人,未经他人同意的数据追踪和人肉搜索也被全面封杀。
这一步迈得极其决绝,甚至让 Anthropic 付出了实打实的商业代价。据外媒披露,早在2026年2月,其首席执行官 Dario Amodei 就因拒绝接受涉及大规模监控与全自主武器的条款,与美国军方产生分歧。到了2026年10月5日,美国国防部官员证实已停止使用其产品。在对手可能通过软化政策去抢夺军工大单的关口,Anthropic 却选择在11月12日的新规里,把自主武器和监控的死穴扎得更紧。
这份长达数千字的合规条款,其实传递出了一个极其鲜明的信号:当人工智能从一个只会打字的信息检索框,变成拥有自主行动力、甚至能操控物理世界机械的数字代理时,人类与它的契约关系已经被彻底重构了。
新规最终究竟会成为一道密不透风的安全防线,还是一份停留在纸面上的道德宣示,很大程度上并不取决于文本写得有多完美,而取决于在日常的交互中,那个学会了保护自己的模型,究竟会以多大的频率,主动对屏幕另一端的人类关上大门。在这个大模型开始具备自主行动力的时代,学会如何不把一个数字系统逼向失控的边缘,正在成为每一个从业者必须面对的必修课。