8月4日,AI安全非营利组织SaferAI发布评估报告显示,中国Z.ai的开源权重模型GLM-5.2在网络和生物双用能力上已接近OpenAI GPT-5.5与Anthropic Claude Opus 4.7,仅落后数月。但在安全实践上差距显著:GLM-5.2对攻击性网络或生物任务零拒绝,而Claude Opus 4.7在CyberGym基准测试中拒绝率极高,导致测试无法完成。
报告指出,前沿闭源模型依赖分类器、拒绝训练和API控制来限制危险输出,但开源权重一旦发布,用户即可在本地移除防护、微调或绕过提示,防护措施失效。Z.ai未公开安全框架、部署前测试承诺或风险评估。SaferAI执行董事Henry Papadatos强调,能力前沿不等于风险前沿,开放权重加速了能力扩散,却让管控变得困难。
与闭源厂商相比,此差距凸显中美路径分化:美国公司更注重灾难性风险评估,中国监管长期聚焦内容合规与社会稳定。开源支持者认为权重开放有助于防御(如Hugging Face曾用类似模型抵御攻击),但批评者警告攻击者采用速度更快于防御方。
未来6-12个月,政策制定者如何在促进创新与限制高风险能力扩散间取得平衡,将成为关键观察点。
信源:https://techcrunch.com/2026/08/04/open-weight-ai-models-are-catching-up-to-the-frontier-the-safety-gap-remains/










