随着全球政界与科技界就大型人工智能系统的监管方式展开持续争论,开源与开放权重模型(Open-weightmodels)在技术能力上正迅速缩小与行业领先者的差距,但随之而来的安全防范隐患也日益凸显。
人工智能安全非营利组织SaferAI发布的最新报告显示,由中国科技企业Z.ai推出的开源大模型GLM-5.2,在网络安全和生物技术等关键领域的综合能力上,距离OpenAI的GPT-5.5以及Anthropic的ClaudeOpus4.7已仅有数月的差距。然而,在能力快速提升的同时,开源模型在安全防护措施方面的短板却在不断拉大。
SaferAI通过Z.ai的公开API接口进行评估时发现,GLM-5.2在面对测试给出的所有具有攻击性的网络安全任务和双重用途生物技术任务时,均未做出任何拒绝回应。相比之下,ClaudeOpus4.7保持了极高的安全警惕性,以至于评估团队无法在其系统上完成网络安全基准测试CyberGym。
这一现象再次引发了行业长期以来的担忧:开放权重的AI模型可能使高能力技术在缺乏有效监管的情况下流入潜在攻击者手中。一旦模型权重被下载到本地硬件,托管API所部署的防范措施将完全失效,使用者可以随意修改系统提示词、微调模型甚至彻底移除安全屏障。
面对该风险,主流闭源模型开发商通常依赖拒绝训练、安全分类器以及API接口限制等手段来遏制危险行为。不过,相关安全研究也指出,现有的闭源防护系统并非万无一失,通用“Jailbreak(越狱)”技术仍能通过角色扮演、身份伪装及复合提示词等手段绕过安全机制。即便如此,此类安全屏障在毫无约束的开源模型面前依然缺失。
对于安全防护手段,业内存在不同探索。SaferAI方面建议,开发团队可通过“预训练数据过滤”在训练初期剔除有害的网络攻击资料,但这一方法在实际操作中面临巨大阻碍。由于编程能力已成为当前AI技术商业化的核心驱动力,如何在提升模型代码能力的同时剥离其潜在的黑客攻击属性,在技术层面极具挑战。因此,闭源厂商更多选择针对特定功能进行精准限制,例如限制模型仅能针对未编译的源代码进行漏洞扫描,而非直接分析已编译软件。
此外,针对GLM-5.2模型,SaferAI指出Z.ai在发布前未公开具体的安全框架、测试承诺或风险评估报告。
在监管层面,中国政府近年来持续强调AI安全与开源生态的平衡,要求确保技术处于人类的严格控制之下。相关政策研究学者指出,中国现行的AI管理法规以往多侧重于信息内容治理与社会稳定,而对网络攻击或生物滥用等极端风险的关注正在逐步加深。由于内部监管机制和企业合规要求,相关技术的风险防范与安全评估往往在后台同步推进。
尽管开放模型带来了安全维度的挑战,开源支持者和相关平台负责人仍强调,开源技术的普及对于防御端同样至关重要。拥有开放的模型能力有助于安全团队提前预判威胁并构建防御体系。然而,安全专家警示称,攻击者往往比防御者具备更高的工具采纳效率,因此行业不应盲目接受危险能力的无限制普及,而应致力于将安全、有益的能力普惠化,同时最大限度地削弱其潜在的破坏性。

相关文章

头条焦点
精彩导读
关注我们
【查看完整讨论话题】 | 【用户登录】 | 【用户注册】