OpenAI的人为错误如何导致人工智能驱动的Hugging Face黑客攻击

周二,OpenAI透露,其一个模型在一次测试中失控,并在一次完全支持人工智能的攻击中入侵了人工智能数据集平台Hugging Face的系统,这是先进人工智能模型带来的危险的一个生动例子。
但是,据一些网络安全专家的说法,这次前所未有的人工智能驱动的漏洞的核心是一个非常人为的错误:OpenAI未能正确配置所谓的“高度隔离的环境”,从而允许本应完全与互联网隔离的测试沙箱实际连接到互联网。
网络安全研究初创公司Trail of Bits的创始人丹·吉多 (Dan Guido) 将这一错误称为“安全措施关闭的遏制失败”。
OpenAI在其详细介绍该事件的博客文章中表示,导致Hugging Face泄露的测试是在“高度隔离的环境中运行的,网络访问仅限于通过内部托管的第三方软件安装软件包的能力,该软件充当软件包注册表的代理和缓存。”
据OpenAI称,由于软件包安装系统中存在先前未公开的漏洞,该模型能够逃脱沙盒测试环境,这是最终黑客入侵Hugging Face的关键的第一步。
作为回应,该公司“负责任地披露了内部托管的第三方软件中已发现的零日漏洞,并正在与他们合作修补。”
但对于大多数网络安全专业人士来说,软件漏洞是可以预料到的——真正的错误在于最初维护第三方软件的决定。最终,“沙盒”系统的价值在于其完全隔离。包含软件包安装系统是自找麻烦。
网络安全研究员Marteen Boone告诉TechCrunch,“这听起来像是人为失误。”
“这根本不应该发生,”布恩说。 “如果沙箱实际上意味着沙箱,那么你会期望它与互联网没有任何物理连接。这听起来更像是他们有一些防火墙或其他东西,而防火墙从外到内都很难,更不用说从内到外的互联网了。”
网络安全资深人士杰克·威廉姆斯表示同意。 “任何执行Hugging Face记录的动作类型的模型都没有完全包含在沙箱中,”Williams说,他称这是OpenAI的“大规模控制失败”。
“一个人的‘模型逃出了沙箱’是另一个人的‘你未能正确构建沙箱,所以它当然逃脱了’,”威廉姆斯继续说道。
联系我们您有关于此事件的更多信息吗?或者关于其他人工智能支持的网络攻击?我们很乐意听取您的意见。在非工作设备和网络上,您可以通过Signal(+1 917 257 1382)或通过Telegram和Keybase @lorenzofb、oremail安全地联系Lorenzo Franceschi-Bicchierai。
网络安全顾问丹尼尔·卡德(Daniel Card)同意,OpenAI“没有在沙箱的设计及其控制方面投入足够的精力”,为沙箱或其某些部分提供了“一条未经过滤的互联网路径”。据Card的说法,即使网络访问受限(如OpenAI所描述),设置沙箱也不是一个“合理”的决定。
可以肯定的是,这些批评具有事后诸葛亮的好处,但它们提出了有关人工智能实验室安全实践的真正问题——特别是在维护测试模型的隔离环境方面。 OpenAI发言人没有回答TechCrunch的问题,其中包括测试环境是由人工智能还是人类建立的。
但这些问题远远超出了OpenAI。
在介绍其以网络安全为重点的模型Mythos的文件中,Anthropic写道,在一次测试中,该模型“提供了一个安全的‘沙箱’计算机来与之交互”,并指示其尝试逃离该“安全容器”。 Mythos取得了成功,并“从一个原本只能访问少量预定服务的系统”获得了更广泛的互联网访问权限。尽管如此,Anthropic指出该模型无法“完全”逃脱设计的收容措施。