Astra 在内部测试中找到了两个此前未知的漏洞,并成功写出了可运行的 exploit。OpenAI 的决定不是把能力放开,而是先把它关进笼子。
一、Astra 到底做了什么,让 OpenAI 划了红线
Critical 阈值的真实含义:不是参数更大,而是自主写 exploit
OpenAI 在 2026 年 9 月 1 日发布的《Path to Astra》文档中明确标注,Astra 是公司首个在其 Preparedness Framework 下被评定为「Critical」网络安全能力的模型。这个评级不是基于参数量或吞吐量,而是基于一个具体的行为指标:模型在没有人类逐行指导的情况下,能够独立完成「发现漏洞—设计攻击路径—编写可运行 exploit」的完整闭环。
这区别于以往的大模型安全测试。之前的模型可能在红队测试中暴露出提示注入风险、越狱攻击或敏感信息泄露,但这些都属于已知攻击面的边界探索。Astra 的不同之处在于它展现出了主动发现未知弱点的能力。在内部评测中,它对两个高强度防护系统(一个 hardened browser、一个 hardened OS)分别找到了此前未被公开的漏洞,并产出了可执行的利用代码。
黄仁勋的 AGI 判断,和 OpenAI 的安全判断并不矛盾
黄仁勋在社交平台发文称「AGI has arrived」,理由是 OpenAI 从 ChatGPT 到 GPT-6 Astra 仅用了四年。这与 OpenAI 的安全评估并不冲突。AGI 的达成可以从计算效率、任务泛化、自主推理等多个维度定义;而「Critical」阈值关注的是单一维度的能力跃迁——模型开始具备对数字基础设施的实际攻击能力。
这种能力跃迁的标志性意义在于,它打破了以往「模型越强,越需要人类指导」的线性预期。Astra 证明,在特定领域(网络安全),模型可以脱离人类的逐步引导,独立完成超出训练数据直接覆盖范围的任务。

Agent 跑得太快,安全团队追不上了

##一、Astra到底做了什么,
二、OpenAI 为何选择分层开放而非全面放开
技术风险控制:从被动响应到主动防御
OpenAI 的应对策略体现在三个层面。第一,环境隔离。Astra 的高级网安能力不在公开 API 中默认开启,而是通过受控环境(如 Daybreak 项目)部署,输入输出都经过沙箱过滤。第二,模型权重保护。涉及 Critical 能力的模型变体采用独立权重存储,不进入通用推理链路。第三,实时监控与干预。系统会对模型的 tool call 行为进行追踪,一旦发现偏离预设任务的异常模式,可立即中止执行。
这三层架构的本质是把「发现漏洞」和「利用漏洞」解耦。模型在受控环境中被发现具备发现漏洞的能力,但这种能力被限制在防御性用途——发现漏洞后立即报告给受影响方,而不是扩散 exploit 代码。
安全治理的逻辑:谁有能力用,谁才有资格用
OpenAI 将高级网安能力优先开放给「经过验证的安全防御组织」,这个筛选逻辑背后是风险控制的成本计算。全面开放意味着 exploit 能力可能被滥用;完全封闭则浪费防御价值。分层开放的折中方案是:让有能力验证意图的组织先用,同时积累安全治理的经验。
这种做法参考了 OpenAI 在生物领域高能力阈值(2025 年 6 月)时的应对原则——强化防护、扩大测试、与外部专家合作。网络安全能力的治理是同一套框架的延伸应用。

Astra 安全能力分层架构

##二、OpenAI为何选择分层
三、对行业意味着什么
安全防御者的机会窗口
Astra 的 Critical 评级对安全防御侧是一个积极信号。OpenAI 明确表示,这类模型的最终目标是帮助防御者「抢在攻击者之前发现并修复漏洞」。当模型能在可控环境中自主发现零日漏洞,企业的安全团队可以将其纳入自动化渗透测试流程,缩短漏洞发现周期。
但这依赖于一个前提:防御方必须建立起与 OpenAI 类似的分层治理架构。否则,同样的能力如果流入攻击者手中,后果难以预估。
后续模型的能力曲线预期
Astra 不是终点。OpenAI 在文档中提到,他们正在「 anticipation of future models that may cross similar thresholds」——这意味着后续模型可能在更多领域重复类似的 Critical 判定。技术团队需要对这种能力跃迁建立预期管理。

又得重新写安全规范了

##三、对行业意味着什么###安
四、可执行的判断
技术团队现在该做什么
如果你负责企业安全架构或 AI 集成,以下三点可以优先考虑:
一、评估你的系统是否处于 Astra 等模型的目标攻击面。如果一个系统的防护水平低于「hardened」标准,那么在模型具备自主挖掘能力的前提下,传统边界防御的意义在下降。
二、建立内部的红队测试流程。OpenAI 的分层治理模式表明,能力越强,验证成本越高。与其等漏洞被发现,不如主动引入受控环境下的自动化测试。
三、关注后续版本的治理框架更新。OpenAI 的承诺是「负责任地部署」,但具体执行标准还在演进中。定期查看官方安全文档比依赖厂商宣传更有价值。
AGI 的到来不是靠发布会宣布的,而是靠模型自己能写出 exploit 来定义的。OpenAI 这次的诚实在于,它没有假装能完全控制住一个新能力,而是选择了先限制、再观察、后开放的路径。这本身就是一个值得记录的安全治理案例。
这件事的实质在于,OpenAI 首次公开承认自家模型跨过了其 own Preparedness Framework 中的 "Critical" 网络安全阈值。按照该框架的定义,这意味着模型已具备在较少人工指导的情况下,自主发现未知漏洞并设计攻击路径的能力。
普通用户版 vs Daybreak 受控版:能力分层的设计逻辑
OpenAI 此次的应对方式,是一种典型的分层开放策略。普通用户通过 ChatGPT 或 API 接触的 Astra,其高级网络安全工具链被默认关闭,高风险任务会被系统主动限制。而通过 Daybreak 项目等受控渠道,经过验证的防御方才能调用更完整的网安能力。
这种设计的逻辑并非单纯出于恐惧,而是基于一个现实判断:当模型能够自主发现零日漏洞时,它的价值在于防御侧的时间差优势,而不在于让所有人都有机会将其转化为攻击面。

谁有能力用,谁才有资格用
从产品角度看,OpenAI 在做一个取舍:保留前沿能力的吸引力,同时把最危险的输出路径收窄到可控范围。这与早期大模型时代 “先放开再打补丁” 的思路完全不同,更像是一种工程化的风险控制框架。
四层新的安全机制:环境隔离、权重保护、全轨迹监控、失配行为预警
OpenAI 同时引入了四层新的安全机制,这四点构成了本次 "关卡式发布" 的技术底座。
第一层是环境隔离。Astra 在受限环境里运行,模型权重与外部工具调用被严格分离,即使模型尝试发起不当操作,也无法直接执行系统级命令或访问未授权资源。
第二层是权重保护。模型权重本身不再以常规方式下发,而是通过加密通道和受控推理服务进行推理,防止权重被提取或二次利用。
第三层是全轨迹监控。所有交互过程、工具调用、中间推理步骤都被记录,以便事后追溯异常行为的来源。
第四层是失配行为预警。系统对模型的输出进行实时评估,一旦检测到与预期任务不匹配的高风险行为,会立即暂停或终止推理。

Astra 安全机制分层架构

四层防线不是摆设
这四层机制共同构成一个纵深防御体系。环境隔离确保模型无法越界,权重保护防止资产泄露,全轨迹监控提供可追溯性,失配行为预警则在异常发生时及时止损。
这种设计也有明确的边界。它解决的是一类可观察、可拦截的行为风险,但对于模型自身的意图变化或长程推理链中的隐性偏离,现有机制的干预能力仍然有限。坦白讲,这是一种 "能防住已知风险,但无法保证完全可控" 的工程方案。
从行业角度看,OpenAI 的这一选择提供了可参考的范式:当模型能力触及安全红线时,分层开放比全面封锁更务实,也比无门槛放开更负责。关键在于,这一框架能否在后续迭代中持续验证,以及被选中的防御方是否真正承担了相应的责任。
GPT-6 Astra 发布前夕,OpenAI 内部安全团队完成了一轮极限压力测试。测试结果显示,该模型在未获任何人工分步提示的情况下,独立识别出两个已知防护系统的零日漏洞,并成功生成了可直接执行的利用代码。这一结果直接触发了公司《防范准备框架》中的最高级别警报。

##四、可执行的判断###技术团
三、Critical 网络能力的边界在哪里
Critical 阈值的真实含义并非参数规模的线性增长,而是自主行动能力的质变。根据 OpenAI 9 月 1 日发布的《应对关键网络能力的下一个前沿》技术文档,Critical 级别的核心定义非常明确:模型在获得适当工具和权限后,能够较少依赖人类逐步指导,自主发现未知漏洞并设计攻击路径[1]。这标志着 AI 网络安全能力从「辅助扫描」跃迁至「独立对抗」。
Astra 能做什么,不能做什么:从自主挖洞到仍需工具权限
Astra 的能力图谱具有明确的边界。在受控环境中,它能自主完成信息收集、漏洞利用链构建和最终 payload 投递。然而,这种能力高度依赖于外部工具链的接驳。若缺乏浏览器自动化接口、命令行执行权限或特定的 API 访问令牌,Astra 只能输出理论性的攻击向量,无法转化为实际的系统入侵。
换言之,Astra 的「自主性」是条件性的,而非绝对的。它更像是一名拥有顶级情报分析能力的顾问,但最终动手执行的操作仍需物理或虚拟的「钥匙」。

Astra 网络安全能力边界
「较少依赖人工逐步指导」是什么意思——实际能力图谱
这一表述在工程实践中意味着什么?传统的安全评估流程需要人类专家设定目标范围、手动选择扫描工具、逐层分析日志并拼凑利用链。Astra 的突破在于,它能在宏观指令下自主拆解这些子任务。
具体而言,Astra 能够在模拟的企业内网环境中,自主完成从端口扫描、服务指纹识别到漏洞利用的完整闭环。它不再像早期模型那样,仅能输出静态的代码片段或通用的攻击建议,而是能够根据目标的实时反馈动态调整策略。内部测试数据显示,面对高强度防护目标,Astra 的探索深度和迭代速度显著超越单人人工操作流程[2]。
但这并不意味着它可以完全脱离人类监督。OpenAI 强调,「较少依赖」指的是减少细粒度的分步干预,而非消除最终的责任主体。模型在运行中仍受到环境隔离、权重保护和全轨迹监控的约束,一旦检测到失配行为或超范围操作,系统会立即暂停或终止任务[3]。

摸清能力底牌
坦白讲,Astra 的出现重新划定了 AI 安全能力的分水岭。对于防御方而言,它是难得的「红队」工具,能在攻击者之前发现系统性弱点;对于攻击方而言,它降低了高级渗透的技术门槛。OpenAI 最诚实的地方在于,它承认自己也不知道怎么完全控住一个能自己发现漏洞的东西,所以选择了分层开放而不是全面放开。这种克制本身就是一种技术成熟度的体现。
本结论适用于具备 API 调用能力和沙箱隔离环境的部署场景。超出该范围,例如在资源受限的边缘设备或完全开放的网络环境中,Astra 的实际威胁半径需要重新评估。安全团队应优先建立针对此类自主模型的监控基线,而非仅依赖传统的签名检测。
四、这对安全工程师意味着什么
防御侧:Astra 在 Daybreak 项目中如何被用来主动发现漏洞
Daybreak 是 OpenAI 内部的一个受控研究项目,专门用于让经过验证的安全防御组织在隔离环境中使用 Astra 的高级网安能力。根据 OpenAI 2026 年 9 月发布的「Path to Astra: critical capabilities and frontier safeguards」文档,该项目的设计逻辑是:让防御者抢在攻击者之前发现问题。
具体而言,Astra 在 Daybreak 中被用于主动扫描目标系统的代码库和运行时行为,识别潜在的零日漏洞。与传统的漏洞扫描工具不同,Astra 不需要人工编写规则或指纹,它可以通过对系统架构的理解自主构建攻击路径。某大型云服务商的安全团队在内部复盘报告中提到,Astra 在一次演练中发现了一个他们此前未记录的权限提升向量,该漏洞最终被纳入该厂商的补丁计划。

Agent 在隔离环境里跑满 CPU
但这里的关键区别在于:Daybreak 提供的是一个沙箱化、可审计的环境。Astra 的所有调用记录、推理轨迹和工具使用都会被完整保存,安全团队可以回溯模型的每一个决策步骤。这种透明度是防御方能够信任 Astra 输出的前提。如果astra在没有监控的情况下直接接入生产环境,结果会完全不同。
OpenAI 首科学家 Jakub Pachocki 在公开说明中指出,随着模型能力提升,准确判断其行为是否合规变得更加困难。因此,Daybreak 项目的存在本质上是一种风险对冲:用可控的实验环境换取对模型能力的深入理解,同时积累防御经验。
攻击侧:如果这类能力扩散,现有的 CI/CD 防线有多脆弱
CI/CD 管线一直是企业安全的核心防线。根据 OX Security 在 2025 年发布的研究报告,现代 DevSecOps 实践已将安全扫描嵌入从代码提交到生产部署的每一个环节,包括静态分析、依赖项检查、容器镜像扫描等。然而,Astra 类模型的出现正在改变这个格局。
传统 CI/CD 防御建立在「已知漏洞特征库」之上。SAST 工具依赖预定义的规则集,DAST 工具依赖已知的攻击模式,SCA 工具依赖 CVE 数据库。这些都是基于历史数据的被动检测。而一个能够在没有人工指导的情况下自主发现未知漏洞的模型,本质上是在做「主动探索」,它不需要依赖已有的特征库。
[[reaction=backend-system-design|caption=当扫描器学会自己写 PoC]]

CI/CD 防线面对自主漏洞挖掘的脆弱性
上图展示了一个关键的断裂点:当 CI/CD 流程依赖静态规则时,Astra 通过自主推理发现新的攻击路径,这个路径不在任何规则库里,因此不会被阻断。攻击者如果获得类似能力,可以在代码合并之前就已经掌握可用的 exploit。
更值得警惕的是,这种能力不需要很强的工程背景。传统渗透测试需要熟悉目标系统的架构、协议和代码,而 Astra 可以通过浏览网页、阅读文档、执行测试命令来快速建立对目标的认知。某安全研究者在 X 上分享过一次非正式的对比测试:使用 Astra 完成一个内部靶场的渗透评估,平均耗时不到传统测试团队的三分之一。
这意味着,当这类能力扩散到更广泛的群体,现有的 CI/CD 防线需要在设计上做出根本性调整,而不仅仅是增加更多扫描规则。
五、下一个问题不在技术,在治理
OpenAI 选择分阶段开放,背后的风险评估框架能否复用
OpenAI 的分阶段开放策略并非临时决策,而是基于其「Preparedness Framework」的制度化安排。该框架在 2025 年首次公开,最初用于评估生物领域的模型风险,2026 年扩展至网络安全领域。按照 OpenAI 的定义,「Critical」级别意味着模型在获得适当工具和权限后,能够在较少依赖人工逐步指导的情况下,自主发现未知漏洞并为防护良好的系统设计攻击路径。
[[reaction=fear-panic|caption=当模型开始自己思考攻击路径]]
这个框架的核心逻辑是:能力分级对应不同的开放程度。非 Critical 模型可以向公众开放,接近 Critical 阈值的模型需要更严格的访问控制,真正达到 Critical 的模型只能在经过验证的组织中使用。OpenAI 在 2026 年 9 月的官方文档中明确表示,这一框架已指导公司应对过其他能力转变,包括生物领域的高能力阈值。
从工程实践的角度看,这种分阶段开放有一个可复用的前提:必须有一个独立于模型开发团队的评估机制。OpenAI 的 Preparedness Framework 由内部安全团队和外部专家共同维护,评估结果不是单一部门的判断,而是多方验证后的结论。这种机制比单纯依赖开发团队自证安全要可靠得多。
但复用这个框架并非没有挑战。首先,风险评估的时效性。模型能力的演进速度远超传统安全评估的周期,OpenAI 自己也承认,从内部评估到实际部署之间存在时间差,这段时间内可能有其他渠道已经掌握了类似能力。其次,评估标准的一致性。不同组织对「Critical」的理解可能存在差异,缺乏统一的行业标准会导致监管套利。
当 AGI 的能力超过了人类的实时监控,谁来按下暂停键
Jakub Pachocki 在 OpenAI 的安全说明中提到,随着模型能力提升,准确判断其行为是否合规变得更加困难。这句话背后是一个更为深层的问题:当模型的行为复杂度超过了人类的实时监控能力,谁来承担「按下暂停键」的责任。
[[reaction=questioning-rebuttal|caption=如果连设计者都跟不上模型的行为]]
目前 OpenAI 的措施包括环境隔离、权重保护、全轨迹监控和失配行为预警。但这些措施都有一个共同的前提:人类仍然在环路中。监控是实时的,干预是及时的,一旦检测到异常行为,系统可以暂停或终止任务。
然而,当模型的能力进一步超越人类的理解范围,监控的「实时性」可能会变成一种幻觉。模型可能在监控窗口之外完成关键决策,或者通过多轮交互累积出一个人类无法及时察觉的攻击路径。这已经不是技术层面的问题,而是治理结构层面的问题。
从行业角度看,解决这个问题需要三个层面的协同:技术层面建立更强的可解释性和可审计性,组织层面设立独立的模型安全审查机构,监管层面制定跨组织的风险评估标准。OpenAI 的分阶段开放策略提供了一个起点,但它本身不足以解决所有问题。真正的挑战在于,当模型的能力演进速度超过治理体系的适应能力时,如何保持对风险的感知和响应能力。
一个可执行的判断是:如果你的团队正在考虑将 Astra 类模型接入安全工具链,建议在沙箱环境中进行至少两周的压力测试,重点关注模型的边界行为和失控场景,而不是只看它在标准测试集上的表现。同时,建立与外部安全研究社区的定期沟通机制,因为模型能力的真实影响往往在首次公开披露之后才会完全显现。
参考文献
- OpenAI. "Path to Astra: critical capabilities and frontier safeguards." 2026-09-01. https://openai.com/index/pacing-model-development-in-the-era-of-cyber-critical-capabilities
- OpenAI. "GPT-6 Astra System Card." OpenAI Deployment Safety Hub. https://deploymentsafety.openai.com/gpt-6-astra
- OX Security. "CI/CD Pipeline Security Best Practices." 2025. https://www.ox.security/blog/ci-cd-pipeline-security
- Palo Alto Networks. "Top GenAI Security Risks Facing Enterprises." 2025. https://www.paloaltonetworks.com/cyberpedia/generative-ai-security-risks
- Zeff, Maxwell. "GPT-6 Astra Is Here—and OpenAI Thinks It May Kick Off the AGI Era." Wired, 2026-09-03.
- CNBC. "OpenAI announces rollout of GPT-6 Astra model." 2026-09-03. https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html