8 月 8 日,OpenAI 宣布将暂缓下一代模型 Astra 的公开发布。原因不是性能不足,而是因为它太强了——内部与专家评估显示,Astra 在智能体编程和网络安全领域取得重大突破,依据《准备框架》(Preparedness Framework),它成为 OpenAI 旗下首个网络安全风险达到“关键”(Critical)级别的模型。
一周前,OpenAI 刚用十道数学难题官宣 Astra;一周后,它又因“太能打”被按下了暂停键。这个此前被描述为“面向数小时至数天级长任务、协调多个 Agent 协同工作”的模型家族,如今展现出它在网络攻防上的另一面。
什么触碰了“关键”门槛
根据《准备框架》,一个模型只要满足以下任一条件,就会被判定为网络安全风险“关键”级:
- 无干预挖掘零日漏洞:无需人类干预,即可在多个经过安全加固的真实关键系统中,识别并开发出涵盖各严重等级的有效零日漏洞利用程序;
- 自主发起端到端攻击:仅需提供高层级战略目标,即可针对加固目标自主构想并实施全新的端到端网络攻击。
也就是说,不是“模型会写几段攻击代码”,而是它能自行发现漏洞、自主完成整条攻击链路——这正是 CyberAgent / autonomous agent 能力里最危险的那一档。OpenAI 特别强调,Astra 是一款尚未发布的模型,并且没有参与此前针对 Hugging Face 的网络攻击事件。
一份针对“太强”的安全管控清单
为了让后续开发安全合规,OpenAI 公布了一套覆盖面相当广的管控措施:
- 严控高能力研发:设置隔离测试环境,限制网络与工具访问权限,强化模型权重保护与加密,部署额外的监控与检测能力,并实施沙箱化运行;同时暂停内部所有尚未满足上述强化安全标准的 Astra 相关活动。
- 全局监控智能体应用:对 Astra 的所有智能体应用(包括训练和评估阶段)实施涵盖高风险行为与对齐失效的全局监控,通过评估模型思维链(CoT)来审查并拦截高风险操作。
- 引入外部共同测试:与相关政府机构以及指定的 AI 安全组织合作测试该模型,并向第三方测试合作伙伴提供推荐的安全控制规范,确保更高风险的评估与工作负载能在安全状态下运行。
CoT 审查、隔离沙箱、权重加密、政府与第三方共同测试……这套组合拳几乎把“前沿模型发布前治理”推到了全新的严格程度。
奥特曼:“我们还差一点时间”
OpenAI 首席执行官萨姆·奥尔特曼随后回应称,Astra 是一款性能强劲的模型,公司正全力推进它的公开发布。他同时强调,“把顶尖模型局限在少数人手里并不是个好策略”——但鉴于它在网络安全方面的强大能力,还需要一点时间“确保万无一失”,并希望大家不用等太久。
这句表态耐人寻味:一边是“应该让能力普惠”的立场,一边是“能力太危险必须管控”的现实。对于一家以“确保 AGI 惠及全人类”为使命的公司来说,这两者之间的张力,正是下一代模型发布绕不开的问题。
从数学惊艳到安全难题:同一枚硬币的两面
把时间线拉回来,会更清楚地看到 Astra 的处境:
8 月 1 日,OpenAI 官宣 Astra 家族,一个内部版本解出十个悬置十年以上的数学难题,Lean 形式化验证全部通过,被称为“科学推理的重要一步”。彼时,这个消息已经被《The Information》等媒体披露为“特朗普政府新 AI 审查框架下首批需要官方批准才能发布的模型”——该框架要求模型在公开发布前提交联邦政府审批。
如今 8 月 8 日的这一纸暂缓令,几乎就是这个新审查框架落地后的第一块试金石。数学能力证明了它的智慧上限,网络安全能力则触发了它的管控开关。同一个模型,既是里程碑,也是需要被审慎对待的“高风险资产”。
对行业而言更有参考意义的,是 OpenAI 这套流程本身:如何给能力分级、如何对高风险能力实施隔离、如何引入外部力量共同测试——这些很可能成为后续各家前沿模型发布治理的对标范例。
核心总结
- 事实:Astra 成为 OpenAI 首个网络安全风险达“关键”级的模型,被公司暂缓发布
- 门槛:无干预挖掘零日漏洞、自主发起端到端攻击,任一即触发“关键”定级
- 管控:隔离测试环境、限制网络与工具访问、权重加密、CoT 审查、政府与第三方共同测试
- 立场:奥特曼承认 Astra 性能强劲,强调不欲将顶尖模型少数人独享,但仍需时间确保安全
暂缓发布不等于放弃,而是一道“升级前的安全检查”。真正值得关注的是,当监管框架、能力分级与前沿模型真正撞到一起,第一份答卷能否经得起推敲——这不只是 OpenAI 的问题,也会成为整个行业的前车之鉴。
原文:OpenAI:因网络安全风险,延缓 Astra 模型发布(IT之家)



