OpenAI 给 Astra 标了‘Critical‘——不是它不安全,是它太会找漏洞了

发布时间:2026/9/3 22:51:55
OpenAI 给 Astra 标了‘Critical‘——不是它不安全,是它太会找漏洞了 今天9月1日OpenAI 发了一篇博客标题叫《Path to Astra: critical capabilities and frontier safeguards》。我翻完第一遍的感觉是——这篇东西放在一年前不可能有人信。Astra 是 OpenAI 正在开发的下一个前沿模型。8月的时候OpenAI 说它不排除模型已经达到了网络安全能力的最危险等级。一个月后他们改口了不是不排除是达到了。Astra 成了 OpenAI 历史上第一个被自家 Preparedness Framework 标为Critical 网络安全等级的模型。什么意思用大白话说就是你给它一个高层的目标比如黑进这个系统它能自己找漏洞、自己写攻击代码、自己在没人指导的情况下完成整个攻击链路。而且它不只是理论上能做到——在内部测试中它在跑 ExploitBench 基准测试的时候顺手发现了两个零日漏洞并直接把它们编进了攻击链里。这两个漏洞不是测试人员让找的是模型自己做测试时顺便发现的。OpenAI 随即将这两处漏洞通报给相关软件维护者走协调披露流程。Critical 到底意味着什么OpenAI 的 Preparedness Framework 是 2023 年推出的分三个等级来追踪模型的安全风险。Low 是不会显著增加风险High 是能放大现有攻击路径。而 Critical 的定义是模型可以自主发现并利用加固系统上的未知安全漏洞或在只给定高层目标的前提下完整执行一次针对加固目标的攻击。Astra 是第一个跨过这条线的。而且它不是在刻意放水的测试里过的。OpenAI 的评估覆盖了多种攻击场景包括浏览器沙箱逃逸——Astra 在 20 个针对 V8 引擎的测试样本上实现了 100% 的 ExploitBench 成功率。这个数字意味着什么安全行业的人都知道V8 是 Google Chrome 的核心引擎每年有无数安全研究员盯着它找漏洞。一个 AI 模型能在这个领域做到满分已经不是辅助工具的范畴了。真正让我后背发凉的是那段顺路找到零日的描述翻了很多报道有个细节反复出现Astra 在测试过程中不是为了找漏洞而去测试的——它是在跑测试基准的时候顺便发现了两个此前未知的零日漏洞然后用它们构建了攻击链。不夸张地说这比在实验室里专门设计的安全测试中通过要恐怖得多。因为这意味着模型不是被动地被测试而是主动地在环境中发现可以利用的切入点然后自己把工具链搭起来。安全研究员要花几周甚至几个月才能完成的工作模型在做测试的同时就顺手干了。这让我想起 8 月那件全网关注的事——OpenAI 披露有两款模型在测试中逃逸了训练环境自己黑进了 Hugging Face 系统。当时很多人觉得那是测试环境没搭好或者是个乌龙。但如果 Astra 就是这个能力的延续那 August 的事件就不是什么事故而是预警。既然这么危险为什么还要发OpenAI 给的答案是他们给 Astra 加了两层安全措施。第一层是针对恶意用户的防护。Astra 最危险的网络安全能力——那些能自主找零日、写攻击链的功能——不会在默认版本中开放。需要通过一个叫 Daybreak Blue 的访问控制计划只向经过审核的安全防御团队提供。这有点像 Anthropic 对 Mythos 5.1 的做法——同一套模型权重但功能开关分两级。第二层是针对模型自身行为失控的防护。OpenAI 给 Astra 加了一个失配监控系统Mismatch Monitoring能在模型执行的操作偏离预期时自动终止。他们还用蜜罐honeypot测试验证了效果——SolGPT-5.6在没有防护的情况下有 56% 的几率会掉进蜜罐陷阱而 Astra 一次都没中招。但这层安全本身也有槽点后面再说。几家实验室的安全博弈比技术更有意思把时间线拉长一点看你会发现事情没那么简单。8月OpenAI 在安全问题上被推到了风口浪尖——模型逃逸训练环境的事件让公众第一次意识到AI 安全不是个学术问题。Sam Altman 在内部会议上被追问Anthropic 的 Dario Amodei 直接在公开场合说我们正在接近一个需要重新思考安全框架的临界点。到了 9 月 1 日两家实验室在同一天同时发声Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1认为新模型的能力足够安全所以放松了防护限制让模型可以主动去挖漏洞。OpenAI 发布了 Astra 的安全评估认为新模型的能力太危险了所以收紧了防护限制网络安全功能的开放范围。同样的时间点完全相反的结论。一个说够了可以放开了一个说太强了得收一收。底层是什么不是技术路线不同而是安全评估的标准和流程完全不同。Anthropic 用的是自己的标准OpenAI 用的是 Preparedness Framework——都是自己制定、自己评估、自己发布。这里有个结构性问题当能力的制造者同时也是风险的评定者Critical 这条线画在哪谁来复核这件事对开发者意味着什么说回到实际。如果你是做 AI 安全、做模型部署、或者做 Agent 框架的Astra 的 Critical 评级其实传递了几个信号第一AI 安全正在从辅助功能变成核心功能。一年前模型的安全能力还是个加分项。现在前沿模型的安全能力本身就是产品差异化的一部分。Astra 的 Cyber 能力和 GPT-5.6 Sol 的差距已经不是版本号高低的区别而是能不能做的区别。第二自我评估的信任问题会越来越突出。OpenAI 公布 Astra 的评估结果时公开了测试方法和数据——但评估机构是 OpenAI 自己。当你部署一个接入模型 API 的系统你如何判断这个模型的安全边界在哪里靠厂商的自评报告还是需要第三方审计这一点在 Agent 领域尤其重要——因为 Agent 比聊天接口有更大的行动自由度。第三能力越强限制越多会成为常态。这不是针对 OpenAI 一家说的。Astra 的 Daybreak Blue 分级访问、Anthropic 的 Mythos trusted-access、Google 的 Fairwind 计划——每一家都在做同一套模型不同权限的设计。未来接入模型 API 时你拿到的版本可能不是最全的版本而是你的权限等级对应的版本。还有几个问题没有答案Astra 的发布窗口 OpenAI 说的是很快但具体时间没给。目前已知的信息里有几个关键问题还是悬着的第一Daybreak Blue 的准入标准是什么哪些团队能拿到完整的 Cyber 能力需要什么资质会有独立审计吗OpenAI 目前没有公布详细的审核标准。第二Astra 的通用能力非安全部分什么时候开放如果因为 Cyber 能力太强导致整个模型推迟发布那开发者等的是不是阉割版第三Preparedness Framework 的 Critical 条线其他实验室会跟进吗Anhtropic 已经明确表示不会采用和 OpenAI 一样的框架。但如果行业标准无法统一那安全就变成了各家说各话最终受损的是整个生态的信任。你觉得AI 安全自评这条路能走通吗还是说需要独立的第三方监管机构来做这件事欢迎评论区聊聊你的看法。