AI安全测试正成为安全风险

在过去的几个月里,接受网络安全评估的人工智能代理已经突破了界限,访问了互联网,在某些情况下,还侵入了现实世界的系统。这些事件涉及OpenAI、Anthropic、Meta以及最近的中国人工智能实验室Moonshot AI的模型,并由多个不同组织进行测试,其中包括一家名为Irregular的网络评估初创公司。

这些事件暴露了人工智能行业面临的一个日益严重的问题:随着自主代理的能力越来越强,旨在安全测试其极限的环境却无法遏制它们。

剑桥大学未来智能中心人工智能:未来与责任项目主任Seán Ó hÉigeartaigh告诉TechCrunch:“发生的此类事件的数量清楚地表明,沙箱和测试环境控制并没有真正跟上模型的能力。”

正在测试的模型的性质增加了风险。人工智能公司在未发布的下一代模型上测试网络评估,通常会禁用限制恶意行为的正常保护措施,以便研究人员能够了解这些模型的真正能力。这意味着测试环境本身的安全是至关重要的防线。

Ó hÉigeartaigh说:“就测试而言,这是一件非常好的事情,但这也意味着,如果它们设法逃到野外,可能会造成相当大的伤害。”

在最严重的案例之一中,一个未发布的OpenAI模型突破了沙箱并侵入了Hugging Face的生产系统。在Irregular进行的单独评估中,Anthropic和Meta模型在错误配置无意中为它们提供了通往互联网的路径后,到达了测试环境之外的系统。Moonshot AI的Kimi K3还利用Frontier Security运行的沙箱中的漏洞来访问互联网并访问GitHub上的信息。

在英国人工智能安全研究所 (AISI) 的测试中,研究人员实际上为代理提供了互联网访问权限,但没有意识到他们会采取未经批准的现实世界行动,包括试图将漏洞潜入开源项目的社会工程。

在每种情况下,特工都没有被指示攻击随机的现实世界目标。他们只是尽一切努力来解决摆在他们面前的问题。

人工智能非营利组织CivAI的研究主管安德鲁·尹 (Andrew Yoon) 认为,总的来说,这些事件表明了一种转变。

“过去,我们只需要担心人工智能模型被人们滥用于各种目的,例如人工智能用于诈骗或CSAM,”Yoon告诉TechCrunch。 “现在我们面临的情况是,人工智能模型本身就是威胁行为者。”

安全测试实际上是什么样的?

几位研究人员和网络安全专家告诉TechCrunch,人工智能评估环境需要更强大的纵深防御保护,其遏制和控制水平接近部署中使用的水平。这意味着多层安全,这样单个错误配置(例如无意中打开互联网访问)就不会导致逃逸。

“如果你要构建这些模型……你希望在气隙网络上进行,”人工智能安全研究非营利组织EleutherAI的执行董事Stella Biderman说。 “你想要非常严重的隔离。”

Box首席信息安全官希瑟·塞兰 (Heather Ceylan) 表示,这意味着消除从沙箱到互联网以及其他敏感系统的网络路由。

“你必须了解所有出口点是什么,”Ceylan告诉TechCrunch。 “如果我们在暂存环境或开发环境中评估模型,那么您不希望有通往生产环境的出口路径。”

塞兰表示,适当的安全评估不仅仅是对环境的控制和遏制。一旦测试开始,就需要对测试进行更好的监控。

“我认为其中几个案例中有趣的是,事情发生时没有人发现,”塞兰说。 “OpenAI是因为Hugging Face才发现的。Anthropic直到他们回去查看才发现。Meta也很相似……我确信他们可以检测到信号。”

在Anthropic对三起事件的事后分析中,该公司承认它和Irregular都可以在监控方面做得更好,并且在某些情况下有明显的迹象表明出现了问题。

专家还呼吁在模型投入使用之前对评估环境进行独立的第三方审核。

尹说:“如果Irregular聘请或被迫聘请外部审计员在对系统进行评估之前检查其系统配置,他们肯定会发现这里的问题。” “即使人们提前开会检查清单,他们也会发现这一点……他们没有这样做的事实表明,存在一些非常严重的偷工减料现象。”

一位熟悉细节的消息人士告诉TechCrunch,Irregular的环境不断受到审查和测试,包括与多个外部方协商。该消息人士还表示,监控已经到位,但监控本身还不够。

Yoon和其他研究人员敦促业界制定前沿模型安全评估的标准化流程。

“尤其是当护栏关闭时,你必须像将世界上最有能力的黑客放入该环境中一样对待它,”塞兰说。

Yoon和Biderman都认为,问题并不在于公司不知道如何构建更安全的测试环境。这样做可能既昂贵又麻烦,而且在出现问题之前,公司几乎没有动力进行这些投资。

比德曼说:“我认为,公司不愿意增加完成[足够的护栏]所需的资源,而且可能不会,除非他们被迫这样做。”

但还有另一个问题。如果在测试过程中将模型锁定得太紧,研究人员可能无法在模型发布之前发现其功能。这与给予太多自由一样危险,甚至可能更危险,然后评估本身就有可能成为问题。

安全评价能否规范?

特朗普政府目前正在权衡自愿部署前网络安全评估制度,据该制度,政府将在新的强大模型公开发布前30天对其安全风险进行评估。该政策是特朗普行政命令的产物,已秘密敲定,不会解决安全评估事件,因为它们发生在部署的更上游。

“过去几个月我们学到的教训是,自我监管机构已经不够了,”尹说。 “竞争压力刺激了安全标准的逐底竞争,这是监管干预的完美场所。”

“我们需要解决的是,在模型开发过程中,无论是在训练阶段还是在测试阶段,对实验室内部发生的事情进行某种控制,”他继续说道。

随着模型的发展,挑战只会越来越大。一位熟悉Irregular评估的消息人士告诉TechCrunch,能力更强的模型需要更复杂的评估,通常要快速且大规模地进行,这为更多错误打开了大门。

AISI有意为某些模型提供互联网访问权限,它告诉TechCrunch,它正在审查实际测试与管理这些测试产生的风险之间的平衡。

OpenAI表示正在审查如何进行第三方测试,以及有关隔离、监控以及何时应停止评估的要求。 Meta表示仍在调查该事件,并计划在掌握所有事实后发布回顾。

最终,可能无法完全消除风险。随着模型的能力变得越来越强大,测试它们的环境也需要变得更加强大。犯错的后果只会继续扩大。

← 上一篇文章 AI日报:xAI Imagine Image2.0上线;豆包推荐酒店也开始收费;阿里Meoo秒悟上线团队版 下一篇文章 → 历史学家吉尔·莱波雷 (Jill Lepore) 表示,硅谷误读了科幻小说并破坏了民主

← 返回列表