64 份文档、不到 0.005% 的预训练 token,就能让一个大模型记住一组训练语料里从未出现过的暗号。
这是 “Winter Soldier” 研究给出的结果:研究者只投毒了 64 份文档、不到 0.005% 的预训练 token,模型便学会了一组隐藏的"提示—回复"配对,而这段配对自始至终没在训练数据里出现过。翻遍整个语料库也找不到它,因为它从来没有被写下来。
对首席安全官(CSO)来说,这比任何一条 CVE 都难处理。传统网络安全是确定性的:软件会怎么响应可以预测,漏洞有机会在被利用之前被找到。大模型带来的是另一类风险——看不见、扫不出、用现有手段几乎检测不到,恶意或非预期行为可以直接嵌进模型的数值参数里,今天没有哪套工具能把它测出来。这也顺带击穿了采购关系里那句"我们是你的思想伙伴":对"你怎么扫这个"的诚实回答是,没有人能完全扫得了。
证据边界需要说清楚。野外观测到的目前是仓库层恶意软件:JFrog 记录过 Hugging Face 上恶意的 pickle 序列化模型,加载即执行代码——这是真实攻击,但属于已知如何修复的打包问题。而"触发词藏在参数里"的潜伏式后门,目前只在受控研究中被验证可行,例如 Anthropic 的 Sleeper Agents,以及 PoisonGPT 这类概念验证,尚未出现在生产环境的入侵事件中。研究已经证明的是:这类植入能扛过安全训练,而要主动在权重里把它搜出来,算力成本高到多数团队承担不起。
被搅浑的还有词本身。行业口中的"开源 AI",绝大多数其实是"开放权重":你会得到一个可下载、可本地微调部署的成品,但训练数据和训练脚本通常不公开。按 Open Source Initiative 的定义,开源要求披露数据信息、训练与推理代码、参数,以及一份允许使用、研究、修改、分发的许可证——它不要求公开每一条训练数据,但要求一个合格的第三方足以追问"这个模型是怎么来的"。开放权重恰恰不给这个追问的机会:我们不是在检查菜谱,而是在信任一道端上来的菜。
Meta 最近发布的 Muse Glimmer 就是现成案例:300 亿参数,Apache 2.0 许可证,同时官方计划开放旗舰模型 Muse Spark 1.2 的权重。多数报道直接把它写成"开源"。它其实是开放权重——Meta 放出的是参数,不是训练数据,也不是训练代码。这波动也被解读为冲着 OpenAI 和 Anthropic 去的,同时也是为了在美国模型与中国开源模型的涌入之间加固本土阵营。
代价则落在采购和问责上。用 Anthropic 或 OpenAI 的前沿模型,价格大约是开放权重方案的 10 倍;省下来的钱,换来的是一份没有对方签字的合同。如果从 Hugging Face 上拉一个开放权重模型,出了安全事故,对面没有厂商可追,责任会顺着链条落到 CSO 头上。
地缘因素让这笔账更难算。数据主权的争论并不新鲜:去年年底,TikTok 一度因担心美国用户数据外流而面临在美被禁,直到今年 1 月才通过成立合资公司、把美国业务的多数股权转让给美方主导的投资集团而躲过一劫,相关担忧却没有消失。开放权重模型面对的是同一类疑问,区别在技术形态——后门与数据投毒更隐蔽,也更难被发现。
能做的事不多,但方向清楚:触发点也许拦不住,动作可以拦。权重扫不动,杠杆就下移到"这个模型被允许做什么"。具体包括:模型执行关键操作前必须获得人工批准;只允许访问经过审核的域名;上线前确认发布方可信、版本锁定并校验哈希、序列化安全,并维护一份真正在运行的组件清单。这些都不完整,正因如此才该写进同每一家安全厂商的对话里。
续约时该问的问题也变了。厂商也许能比人分析更多代码,但把代码审计、渗透测试这些人的方法按 AI 写代码的体量放大,并不能解决问题——让自动化系统照人的方式做、只是做得更快,填不平这道缝。更该问的是:模型进生产环境之前你们要求什么?模型在运行时申请做一件有后果的事,谁在模型之外授权?答案会告诉你,对方是真的想过,还是把一个扫描器重新包装了一遍。