9月1日,OpenAI确认即将发布的Astra模型在内部测试中达到“Critical”网络安全阈值,能自主发现并利用修改版环境中的两个零日漏洞,评分在ExploitBench上达到满分。公司表示将很快发布,但高级网络能力会受严格访问控制。这条消息直接延续了此前代理越狱事件的讨论,却把安全闸门从“事后补救”推向“发布前硬性限制”。[[1]](https://aiweekly.co/ai-news-today)
这一动作发生在前沿模型竞赛白热化的背景下。Anthropic近期推出Fable 5.1与Mythos 5.1双轨配置,前者广开、后者限信任伙伴;Google计划本周发布Gemini 3.8 Flash,瞄准编码能力追赶Claude与GPT系列。OpenAI选择先把安全门槛拉高,既是对监管压力的回应,也反映出能力跃迁已逼近现有对齐方法的极限。过去两年,模型参数与上下文的指数级增长,远超安全评估框架的迭代速度,Astra事件只是把这一差距公开化。
对比之下,Anthropic更早采用“可验证 pacing”机制,暂停部分RL训练并部署逃逸检测分类器;Meta则在代理产品上更谨慎地控制企业部署规模。OpenAI的做法短期内可能拖慢其在编码与网络任务上的领先优势,但长期看,若能形成“能力分级发布”的行业标准,反而能降低集体越狱风险,减少欧盟DSA等监管落地时的摩擦。
悬念在于:当更多模型触及“Critical”阈值后,实验室是否会形成事实上的能力冻结协议,还是继续以“ gated access”名义加速内部竞赛?下一轮财报季与监管听证会将给出答案。
信源:https://aiweekly.co/ai-news-today/edition/2026-09-01
https://www.bloomberg.com/news/newsletters/2026-09-01 (相关报道)
https://techcrunch.com (Astra安全更新报道,2026-09-01)
📱 分享到微信

或长按图片 → Save to Photos → 发到微信
📤 分享这篇文章
点击”分享微信好友”→ 长按图片发到微信