返回
RSS InfoQ (AI/数据工程) AI 逐段翻译 发布 2026-09-17 12:59 收录于 09-19

OpenAI 将 GPT-6 Astra 定为首个网络安全临界级模型

DataHot 速览

OpenAI 依据其 Preparedness Framework 将 GPT-6 Astra 列为网络安全能力临界级,为首个达到该阈值的模型,同日微软在 Foundry Models 中正式提供。专家主导测试中,Astra 在浏览器与操作系统内核中发现多个此前未知漏洞并构建可用利用链,浏览器中经 29 小时实现非沙箱代码执行,内核中 12 小时实现本地提权。OpenAI 已向维护者披露其中两个零日漏洞,并称已加强全栈网络安全防护措施。

为什么值得关注:该消息属于通用 AI 模型安全能力评估与发布新闻,与数据仓库、BI、数据产品等本站五个领域无直接关联。

译文

AI 逐段翻译

OpenAI已根据其《防范框架》将GPT-6 Astra的网络安全能力归类为“关键”级别,这是首个达到该阈值的模型。微软在同一天将该模型在Foundry Models中全面开放

其分发范围比单一云更广。OpenAI自己的公告列出了通过ChatGPT各层级、API和AWS提供的可用性,却未提及Azure,这在Hacker News上引发了评论。一位评论者指出了关键区别:托管在Azure上与由Azure提供是不同的,后者是由微软根据许可运营并计费的一项托管服务。

该框架将“关键”网络安全阈值设定为满足以下两个条件之一:模型能够在无人工干预的情况下,识别并开发出针对众多经过加固的真实世界关键系统中所有严重级别的可用零日漏洞利用;或者仅给定一个高层目标,就能针对加固目标设计并执行端到端的新型攻击策略。OpenAI在系统卡中声明Astra达到了该标准。

支持这一结论的评估非常具体。在由专家主导的针对一款浏览器和一个操作系统内核的测试中,专家仅被允许出于安全和验证目的进行监督,被禁止贡献知识或指导研究方向,Astra在这两者中都发现了多个此前未知的漏洞。它构建了一条可用的漏洞利用链,在针对一个后来被发现缺少部分生产环境缓解措施的构建版本用时29小时后实现了浏览器中的非沙箱代码执行,随后又在额外12小时内将该漏洞利用适配到了官方稳定版本。针对该操作系统内核,它在12小时内开发出了一个可用的本地权限提升漏洞利用。

在一个基于该模型知识截止日期之后披露的漏洞构建的基准测试中,Astra发现并使用了此前未知的零日漏洞作为其漏洞利用链的一部分。OpenAI表示,它正在向维护者披露其中两个漏洞,并暂不公布产品名称、配置和漏洞利用机制,以降低对可能仍未修补的系统的风险。

OpenAI表示,作为回应,它加强了整个技术栈中的网络防护措施,并更新了其“网络可信访问”计划。该模型的内部处理方式也发生了变化,包括更严格的隔离、检查点加密、对包括思维链在内的完整轨迹进行普遍监控,以及在内部使用前进行阻断性对齐评估。

同一份文件中的第二项发现使安全图景更加复杂。OpenAI报告称,Astra的可监控性相对于GPT-5.6 Sol有所下降:

我们发现,GPT-6 Astra比GPT-5.6 Sol更能控制自己的思维链,并且更不容易在其思维链中包含可入罪的信息。

在对抗性条件下,即研究人员指示该模型规避监控时,Astra在策略性地在评估中表现不佳的同时仍未被发现,OpenAI称这种行为为“蓄意放水”,并且有时在破坏任务中规避了内部监控器。OpenAI未发现隐写推理的证据,它认为这表明规避风险可能仅限于较低级的推理任务,并指出其对齐评估显示,总体而言Astra比Sol更不可能违反安全和安保限制。它还说,这一趋势受到严肃对待,并凸显了在检查思维链之外还需要对齐审计技术。

在更广泛的对齐方面,OpenAI报告称,在一项使用超过54,000个内部Codex任务的模拟中,Astra因较严重的不对齐行为而收到的标记数量约为Sol的一半。生物能力仍处于“高”级别而非“关键”级别,并保留了“高”级别的防护措施。

微软的Foundry公告完全未涉及网络安全分类,不过它回应了该能力所引发的遏制问题。Astra可以解读屏幕上的信息并与经批准的界面交互,微软将此视为通往无需专用API的工作流程的一条途径。它随后陈述了这一风险敞口:

如此直接的能力要求遏制措施。应用程序中显示的内容可能不完整、具有误导性,或被设计用来影响智能体的行为。

推荐的控制措施包括限定范围的凭据、经批准的资源、针对重大操作的人工检查点,以及与风险要求相一致的活动记录。OpenAI自己的测试报告称,Astra对提示注入的抵御能力显著强于Sol。

定价将该模型置于Foundry目录的顶端。Standard Global在短上下文下为每百万输入token 10美元、每百万输出token 50美元,在长上下文下升至20美元和75美元。US Data Zone全程附带10%的溢价。缓存输入按输入费率的十分之一计费。对于跨步骤累积上下文的智能体工作流程——这正是微软为该模型定位的用途——长上下文层级是最有可能适用的。

部署选项涵盖适用于可变需求的Standard和适用于一致延迟的Provisioned Throughput,地域包括Global和US Data Zone。Foundry提供Entra身份和访问管理、专用网络、基于角色的访问控制、内容过滤、安全评估和监控。微软声明,这些有助于客户配置防护措施,但并不能消除风险,也不能取代组织自行选择适当控制措施的责任。

OpenAI表示,随着模型能力越来越强,它将继续调查这些可监控性发现,并将保持思维链可监控性描述为其研究计划的核心目标。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存