9 月 1 日,Anthropic 直接甩出两个新模型 ——Claude Fable 5.1 和 Claude Mythos 5.1,号称是 "世界上最先进的编程和知识工作模型"。
OpenAI 也不甘示弱,说自家的新模型 Astra 马上就来,但最厉害的网络安全功能只给一小部分测试人员用。谷歌也在暗中开发更强的编码模型,想缩小差距。
三家在同一个时间窗口密集发新模型,说明之前短暂 "熄火" 的大模型竞赛又提速了。但和以前单纯比谁分数高不同,这一轮有个新变化:安全成了主角。

新模型有多强?更聪明,但也更贵了
先看 Anthropic 的成绩。第三方测评显示,Fable 5.1 在好几个编程和推理测试上都拿了最高分。比如 Terminal-Bench 测试拿了 91.4%,SciCode 拿了 62%,都是这个平台见过的最高分。
价格方面有个有意思的操作:缓存读取价格大降 75%,从每百万 token 1 美元降到 0.25 美元。什么意思呢?就是如果你问的问题里有很多内容 AI 之前已经处理过了,那这部分收费会便宜很多。这对企业用户很友好,因为他们经常反复调用类似的内容。
但别以为整体变便宜了。Fable 5.1 最高难度下,完成一次任务的成本反而比上一代贵了 20%—— 因为它输出的内容长度是上一代的 1.7 倍。简单说,AI 想得更细、写得更多,自然就更费钱。
所以现在的成本逻辑变了:输入侧降价是为了降低门槛,但模型推理更深、输出更长,单次总成本反而上升。对企业来说,缓存命中率高不高,直接决定了实际用起来贵不贵。
为什么安全突然成了主角?
这轮竞赛最值得关注的,不是谁的分数更高,而是大家都在谈安全。
OpenAI 的 Astra 模型有个特殊身份:它是 OpenAI 第一个达到 "关键网络安全能力阈值" 的模型。这个阈值是什么意思?就是说在有合适工具和权限的情况下,这个 AI 能自己发现以前没人知道的安全漏洞,还能写出代码在多个受保护系统里利用这些漏洞 —— 而且不需要人一步步教它。
换句话说,AI 已经强到能独立当黑客了。
所以 OpenAI 不敢直接全量发布。奥尔特曼承认,Astra 的训练其实早就完成了,但后续故意放慢了进度,就是为了做安全测试和防护。他们还把之前 Hugging Face 事件的教训融了进去,给 Astra 加了更严格的安全措施,比如训练它拒绝有害的网络请求、增加防滥用保护、监控未经授权的活动。

Anthropic 也没闲着。他们正在深入分析近期的两起安全事件,还找了第三方机构做独立审查。法国 AI 安全中心的负责人透露,Anthropic 已经暂停了高风险强化学习环境的开发 —— 这和 OpenAI 8 月宣布暂停前沿强化学习训练是一个路数,说明两家都被最近的安全事件吓到了。
行业层面也在集体行动。8 月 27 日,OpenAI 联合 Anthropic、谷歌、微软、亚马逊等一百多家机构发了封公开信,警告说 AI 发起的网络攻击会越来越多、越来越复杂,留给大家加固防御的时间不多了。医院、水厂、电网这些关键基础设施,都可能成为目标。
这轮大模型竞赛,标志着行业进入了一个新阶段:AI 已经强到 "能做坏事" 的程度了,所以安全不再是后台的辅助功能,而是和能力并列的核心指标。
以前大家比的是 "谁更聪明",现在还要比 "谁更可控"。这是好事,说明行业开始成熟了 —— 不是一味追求能力突破,而是意识到能力越强、风险越大。OpenAI 和 Anthropic 先后暂停高风险强化学习训练,就是在给竞速踩刹车。
但这里有个根本矛盾:安全和能力天然是冲突的。模型越强,能做的好事越多,能做的坏事也越多。你把安全限制加严了,能力就会打折扣;你放开能力,安全风险就上来了。怎么在两者之间找到平衡,是所有头部厂商都要回答的问题。
OpenAI 把 Astra 的网络安全功能只给小部分人用,就是一种折中方案 —— 先在可控范围内测试,确认安全了再逐步放开。但这种 "小范围测试" 能拦住真正的风险吗?很难说。AI 能力一旦开发出来,就像打开了潘多拉魔盒,你可以限制谁能用,但没法让它变回不会。
对普通用户来说,这轮变化的直接影响可能不大 —— 你用 AI 写文案、查资料,安全功能和你关系不大。但间接影响很深远:如果 AI 网络攻击真的大规模爆发,受影响的是电网、医院、水厂这些公共设施,每个人都跑不掉。所以行业现在花大力气做安全,本质上是在为所有人争取时间。
奥尔特曼说 "任何阶段落后都不是灾难性的,可以通过更好的模型迎头赶上"。这话放在能力竞赛上没错,但在安全赛道上,落后一次可能就是灾难性的 —— 一次大规模 AI 网络攻击造成的损失,可能比模型晚发布几个月严重得多。
大模型的 "能力军备竞赛" 还在继续,但现在大家终于开始给这辆快车装刹车了。问题是,刹车的速度,能不能跟得上引擎的马力。



