OpenAI 的新模型 Astra 还没正式发布,就先触发了公司最高级别的网络安全防护。
原因很简单:这个 AI 太强了,强到能自己当黑客。
Astra 能做什么
OpenAI 安全副总裁格莱斯 9 月 1 日透露,Astra 发现网络安全漏洞的能力,已经超过了目前公开的最先进模型,而且完成同样任务需要的计算资源更少。
更关键的是它的自主性。如果给 Astra 合适的工具和系统访问权限,它不需要人一步步指导,就能自己发现以前没人知道的安全漏洞,还能设计攻击手段,突破多个防护严密的系统。

这在以前是理论上的风险,现在变成了现实。
正因为如此,Astra 被 OpenAI 列为达到 "关键网络安全门槛" 的模型 —— 这是公司安全机制设立以来,第一个达到这个等级的模型。按照规范,只要模型能在极少人工干预下发现并利用新漏洞、规划和执行复杂的网络攻击策略,就必须在研发和发布前采取更严格的防护。
OpenAI 怎么锁它
OpenAI 的应对措施包括:进一步训练 Astra 拒绝有害的网络攻击请求,加强防止滥用的限制,同时全程监控模型活动,一旦发现可能突破安全机制或进行未经授权的操作,立刻中止。
但格莱斯也承认,这些限制有时会拖慢、暂停甚至阻止合法的安全研究工作,公司会设法减少这种误伤。
发布计划也很谨慎 —— 只打算 "不久后" 让一小部分用户使用 Astra,具体日期还没定。
Astra 触发最高级别安全防护,是 AI 发展史上的一个标志性事件。它意味着 AI 的能力已经跨过了一条线:从 "能帮人找漏洞" 变成了 "能自己找漏洞、自己写攻击代码、自己突破系统"。
这条线一旦跨过,就回不去了。

OpenAI 的应对方式是 "先锁起来再慢慢放",这个思路是对的。小范围测试、严格监控、训练拒绝有害请求,这些都是必要的安全措施。但问题在于,安全机制永远是滞后于能力的 —— 你能训练它拒绝已知的有害请求,但它会不会用意想不到的方式绕过限制,谁也不敢打包票。
更值得思考的是行业竞争的压力。OpenAI 把 Astra 锁起来了,但 Anthropic、谷歌、国内的大模型厂商也在往这个方向走。如果别家先发布了具备同等能力的模型,OpenAI 还能稳得住吗?安全和商业利益之间的平衡,在 AI 竞赛中从来都是难题。
对普通用户来说,这件事的影响可能比想象中大。AI 能独立发现和利用漏洞,意味着网络攻击的门槛会大幅降低 —— 以前需要专业黑客团队干的事,以后可能一个人加一个 AI 就能完成。医院、电网、水厂这些关键基础设施的防御压力会指数级上升。这也是为什么 OpenAI 联合一百多家机构发公开信,呼吁集体加强网络防御。
Astra 被锁起来,不是因为它是 "坏 AI",而是因为它太强了。能力本身没有善恶,但能力越强,被滥用的后果越严重。OpenAI 现在做的,是在给这把刚造出来的利刃加刀鞘。问题是,刀鞘能不能永远锁住刀刃,尤其是当所有人都在磨更快的刀的时候。



