Meta 放开权重:0.005% 数据就能埋后门

发布时间:2026/10/4 20:07:13
Meta 放开权重:0.005% 数据就能埋后门 64 份文档、不到 0.005% 的预训练 token就能让一个大模型记住一组训练语料里从未出现过的暗号。这是 “Winter Soldier” 研究给出的结果研究者只投毒了 64 份文档、不到 0.005% 的预训练 token模型便学会了一组隐藏的提示—回复配对而这段配对自始至终没在训练数据里出现过。翻遍整个语料库也找不到它因为它从来没有被写下来。对首席安全官CSO来说这比任何一条 CVE 都难处理。传统网络安全是确定性的软件会怎么响应可以预测漏洞有机会在被利用之前被找到。大模型带来的是另一类风险——看不见、扫不出、用现有手段几乎检测不到恶意或非预期行为可以直接嵌进模型的数值参数里今天没有哪套工具能把它测出来。这也顺带击穿了采购关系里那句我们是你的思想伙伴对你怎么扫这个的诚实回答是没有人能完全扫得了。证据边界需要说清楚。野外观测到的目前是仓库层恶意软件JFrog 记录过 Hugging Face 上恶意的 pickle 序列化模型加载即执行代码——这是真实攻击但属于已知如何修复的打包问题。而触发词藏在参数里的潜伏式后门目前只在受控研究中被验证可行例如 Anthropic 的 Sleeper Agents以及 PoisonGPT 这类概念验证尚未出现在生产环境的入侵事件中。研究已经证明的是这类植入能扛过安全训练而要主动在权重里把它搜出来算力成本高到多数团队承担不起。被搅浑的还有词本身。行业口中的开源 AI绝大多数其实是开放权重你会得到一个可下载、可本地微调部署的成品但训练数据和训练脚本通常不公开。按 Open Source Initiative 的定义开源要求披露数据信息、训练与推理代码、参数以及一份允许使用、研究、修改、分发的许可证——它不要求公开每一条训练数据但要求一个合格的第三方足以追问这个模型是怎么来的。开放权重恰恰不给这个追问的机会我们不是在检查菜谱而是在信任一道端上来的菜。Meta 最近发布的 Muse Glimmer 就是现成案例300 亿参数Apache 2.0 许可证同时官方计划开放旗舰模型 Muse Spark 1.2 的权重。多数报道直接把它写成开源。它其实是开放权重——Meta 放出的是参数不是训练数据也不是训练代码。这波动也被解读为冲着 OpenAI 和 Anthropic 去的同时也是为了在美国模型与中国开源模型的涌入之间加固本土阵营。代价则落在采购和问责上。用 Anthropic 或 OpenAI 的前沿模型价格大约是开放权重方案的 10 倍省下来的钱换来的是一份没有对方签字的合同。如果从 Hugging Face 上拉一个开放权重模型出了安全事故对面没有厂商可追责任会顺着链条落到 CSO 头上。地缘因素让这笔账更难算。数据主权的争论并不新鲜去年年底TikTok 一度因担心美国用户数据外流而面临在美被禁直到今年 1 月才通过成立合资公司、把美国业务的多数股权转让给美方主导的投资集团而躲过一劫相关担忧却没有消失。开放权重模型面对的是同一类疑问区别在技术形态——后门与数据投毒更隐蔽也更难被发现。能做的事不多但方向清楚触发点也许拦不住动作可以拦。权重扫不动杠杆就下移到这个模型被允许做什么。具体包括模型执行关键操作前必须获得人工批准只允许访问经过审核的域名上线前确认发布方可信、版本锁定并校验哈希、序列化安全并维护一份真正在运行的组件清单。这些都不完整正因如此才该写进同每一家安全厂商的对话里。续约时该问的问题也变了。厂商也许能比人分析更多代码但把代码审计、渗透测试这些人的方法按 AI 写代码的体量放大并不能解决问题——让自动化系统照人的方式做、只是做得更快填不平这道缝。更该问的是模型进生产环境之前你们要求什么模型在运行时申请做一件有后果的事谁在模型之外授权答案会告诉你对方是真的想过还是把一个扫描器重新包装了一遍。