开放权重人工智能模型正在赶上前沿。安全差距依然存在。

当政策制定者争论如何管理日益强大的人工智能系统(例如OpenAI的GPT-5.6 Sol和Anthropic的Mythos时,中国的开放权重模型缩小了与行业领导者的差距。
据人工智能安全非营利组织SaferAI的最新报告,GLM-5.2是中国Z.ai的开放权重人工智能模型,在网络和生物功能方面仅落后OpenAI的GPT-5.5和Anthropic的Claude Opus 4.7几个月。但前沿能力和安全实践之间的差距正在扩大。
据SaferAI的评估(该非营利组织通过Z.ai的公共API进行评估),GLM-5.2没有拒绝它所接受的任何攻击性网络或双重用途生物学任务。相比之下,Claude Opus 4.7“一贯拒绝,以至于SaferAI根本无法在其上完成CyberGym”。 (CyberGym是评估网络安全能力的基准。OpenAI在上个月Hugging Face泄露事件之前的评估中使用了它。)
这清楚地提醒人们,一些批评者多年来一直在警告:开放权重人工智能模型可能会将功能强大的人工智能交给潜在攻击者,而一旦他们下载了权重,就无法监管他们如何使用该技术。随着开放权重模型迅速接近世界领先人工智能系统的能力,争论正从它们是否可以竞争转向社会如何在发布后管理风险。
SaferAI执行董事亨利·帕帕达托斯 (Henry Papadatos) 告诉TechCrunch:“能力的边界不是风险的边界,因此我们确实必须考虑缓解措施的状态,以正确评估风险。”
虽然Z.ai可以对其托管的API应用安全措施,但一旦有人在自己的硬件上运行权重,这些保护措施就变得无法执行,他们可以删除或修改任何保护措施、微调模型或更改系统提示。
像OpenAI和Anthropic这样的前沿开发者倾向于依靠分类器、拒绝训练和API级控制等保障措施来限制危险的网络和生物援助。
这些措施远非万无一失:越狱通常会绕过已部署模型的保护。 Far.ai是一家人工智能安全非营利组织,在xAI的Grok 4.5和Google DeepMind的Gemini 3.1 Pro等前沿模型中发现了数百个通用越狱(定义为可重复使用的密钥,可成功完成大多数有害请求)。据该报告,当攻击者结合多种操纵技术(包括角色扮演、权威模仿、虚假对话历史记录和后续提示)来放大模型防御中的弱点时,越狱就会成功。
但封闭模型的保护措施在开放权重模型上根本不起作用,开放权重模型旨在在具有任何保护措施(或缺乏保护措施)的任何基础设施上运行。
帕帕达托斯说:“目标显然应该是让任何人都可以使用良好的功能(安全的功能),然后我们尝试消除不良的功能,即使是以开源的方式也是如此。”
帕帕达托斯指出,一项可以提供帮助的技术称为“预训练数据过滤”,即人工智能公司从训练数据中删除攻击性网络安全信息,然后在精选数据集上训练模型。
一些研究表明,这可以减少危险的生物学知识,而不会损害整体模型的性能。然而,对于网络安全而言,数据过滤的实用性要差得多。
训练一个擅长编码但又不是优秀黑客的通用模型是很困难的。由于编码已成为人工智能最大的赚钱工具,开发人员在寻找限制滥用的方法的同时,也面临着不断改进这些功能的压力。
因此,前沿开发人员越来越依赖其他缓解措施。一种方法是有选择地限制网络安全援助模型将提供的种类。例如,Anthropic的Opus 5可以据模型的系统卡搜索未编译源代码中的漏洞,但不能搜索已编译软件中的漏洞。原因是,这使得使用Opus 5进行攻击变得更加困难。
其他措施包括严格的部署前安全评估、发布风险评估以及在系统被认为过于危险时扣留模型权重。
在GLM-5.2的案例中,SaferAI表示Z.ai没有发布该模型的安全框架、部署前测试承诺或风险评估。 TechCrunch曾询问Z.ai发布前是否进行过内部或第三方边境安全评估,但未得到回应。
中国领导人越来越认识到先进人工智能的风险。在上个月的世界人工智能大会上,中国国家主席习近平强调了开放权重模型的重要性,同时也强调了确保人工智能仍然是人类严格控制下的工具的必要性。
斯坦福大学网络政策中心研究中国人工智能政策的格雷厄姆·韦伯斯特(Graham Webster)告诉TechCrunch,中国对人工智能有严格的监管,但这些规则历来侧重于政治敏感内容、错误信息和社会稳定,而不是攻击性网络能力和生物滥用等灾难性人工智能风险。
韦伯斯特说:“总的来说,美国人工智能思想家比中国社区更关心这种存在灾难性的想法。”他补充说,许多中国政策研究人员认为,如果真的存在新的前沿风险,美国公司可能会首先遇到它。
“中国体系有信心控制这些技术在中国境内的使用,”韦伯斯特继续说道。 “在中国上网是实名制的,公司可以承担责任,用户也可以承担责任。”
韦伯斯特认为,模型提供者用于拒绝参与某些政治话题的机制可以进行调整,以确保模型拒绝完成攻击性网络攻击或不会产生不利的生物工程结果。他补充说,由于中国公司倾向于在幕后与监管机构协调,因此很难知道他们在发布之前正在进行哪些内部测试。
开放权重人工智能的倡导者认为,释放权重对于网络安全非常重要,因为它可以让公司防御攻击——Hugging Face依靠GLM-5.2来防御OpenAI的攻击——而且因为如果他们知道即将发生什么,它可以让他们更好地为未来的威胁做好准备。
Hugging FaceCEO克莱姆·德兰格 (Clem Delangue) 本周在社交媒体帖子中表示:“帮助阻止人工智能网络攻击的系统现在可以帮助每天抵御数百万次网络攻击,同时帮助我们在攻击者利用漏洞之前识别和修复漏洞。”
帕帕达托斯表示,这种好处常常被夸大,并不意味着“我们应该开源危险的功能”。
他说:“我认为的要点是,我们不应该仅仅接受任何人在任何地方都可以轻松访问危险功能的观点。”他强调,他认为该行业应该努力只让“良好的功能”易于访问。默认情况下,攻击者采用新工具的速度比防御者更快。例如,勒索软件组织可以在一周内改变其方法。医院不能。”