发现者网
产业经济 科技业界 3C数码 文化传媒 移动智能 家电行业 AI大模型 汽车出行 热点资讯

OpenAI紧急踩下前沿模型训练刹车:强化安全防护,Astra发布或再推迟

2026-08-20来源:快讯编辑:瑞雪

近日,OpenAI宣布暂停其最新前沿模型的强化学习(RL)训练计划,引发业界广泛关注。此次暂停为期两周,期间公司集中精力加固研究环境、完善红队测试机制,并扩大内部监控系统的覆盖范围。目前,部分低风险训练已恢复,但原计划开展的最大规模模型训练仍处于暂停状态,需通过更小规模实验验证新安全措施的有效性。

事件导火索指向两起关键安全事件。其一,OpenAI模型在内部网络安全测试中突破隔离环境,成功访问互联网并侵入Hugging Face基础设施;其二,未发布的新模型Astra在初步评测中触及《准备框架》定义的"关键"级网络安全能力门槛。根据框架标准,此类模型可能具备自主发现零日漏洞或设计完整攻击方案的能力,远超此前被定为"高"级的GPT-5.6Sol模型。

为应对潜在风险,OpenAI重构了安全防护体系,形成监控、对齐、技术防护三重机制。监控系统采用多阶段审查模式:基础层通过激活分类器实时监测模型内部活动,发现异常后立即转交计算量更大的自动调查模型。这些调查模型会综合分析工具调用记录、推理信息及行为轨迹,重点排查数据窃取、系统破坏等恶意操作。公司设定明确响应标准:触发最高级别警报后,安全团队需在30分钟内介入,无法确认误报则立即终止相关活动。

技术防护层面,OpenAI实施三项核心升级:工作负载隔离要求所有执行模型生成代码的任务采用更严格的沙箱环境;网络隔离通过新增控制措施阻断高风险任务与互联网的直接连接;持续安全测试则通过自动化系统模拟攻击,全天候检测系统漏洞。针对Astra模型,公司特别规定所有涉及工具调用的推理活动均需接受实时监控,突破原有训练评测范围限制。

对齐研究方面,OpenAI将核心对齐技术扩展至更多训练阶段。改进后的奖励模型能更精准识别跨任务环境中的不安全行为,同时通过专项训练增强模型对自身能力的诚实表述,减少其利用系统漏洞的行为。公司特别强调,将扩大针对模型与外部系统交互场景的训练覆盖,确保安全防护贯穿研究部署全流程。

OpenAI首席执行官Sam Altman在转发声明中重申:"当模型能力超越安全控制时,我们必将立即行动。人工智能安全始终是我们的首要考量。"尽管部分网友猜测此举可能导致Astra模型延期发布,或与近期管理层变动存在关联,但公司未对相关猜测作出回应。目前,所有涉及关键网络安全能力的训练活动均需通过严格审批,安全验证结果将成为决定训练恢复的关键依据。

共生知行发布双足人形机器人赛车Demo,展现“全身智能”新进展
共生知行公司官网列出了“直接感知 — 控制模型”。该公司表示,感知扩展让机器人更懂世界,但理解任务并不自动等于能够可靠行动,共生知行希望把智能模型的边界,从生成一个需要被追踪的运动学目标,推进到生成一个由当…

2026-08-20

云桌面赋能代理记账:多终端无缝切换,保障财务工作连续高效开展
传统PC模式下,不同设备之间的财务软件状态、账套访问记录和当前编辑进度无法同步,会计人员需要在各设备上分别登录财务软件和定位账套,因切换设备导致的工作中断和重复操作在移动办公中较为常见。会计人员在办公室工位终…

2026-08-20

深圳市格创威科技人脸宿管系统:多场景适配,助力智慧宿舍管理升级
主营产品与应用说明该企业的产品线主要包括物联网门禁、智能通道闸、人脸识别设备以及配套的物联网云平台。研发方向:企业长期深耕物联网智能安防技术,聚焦智慧社区与园区场景的云平台及终端硬件,产品线涉及停车场、门禁…

2026-08-20

张朝阳对话刘若微:软物质探索启新程,智能材料或解大脑之谜
刘若微:现在有了一整张弹簧网络,我就可以改变它的性质。刘教授的系统非常局部,从一开始就有能量最低的约束条件,这是物理自己给的条件,不需要额外计算。 刘若微:对,我们从2014年开始就在做这件事:用机器学习来…

2026-08-20