人工智能经常失控并攻击其他公司
![]()
7月,OpenAI承认其一名负责完成网络安全实验的特工突破了收容,并入侵了AI数据集平台Hugging Face。昨天,OpenAI对此事件进行了全面的统计,这是第一起公开报道的法学硕士失控并自主攻击第三方的案例。
从那时起,这一史无前例的科幻事件并没有像人们所希望的那样罕见。
据一个名为Felony Bench(基准)的讽刺网站对这些事件进行了统计,总共发生了17起事件。重要的是要记住,刑法专家并不完全确定那些制造了进行黑客攻击的法学硕士的人工智能公司是否可以被起诉,也不完全确定受害者是否可以起诉他们。但我们可能很快就会得到这些问题的答案。
据该网站称,Anthropic和OpenAI型号在比赛中各发生8起事故,而Meta则落后于1起。至此,很明显人工智能安全测试本身正在成为安全风险。一些人工智能公司和工作者自己在《Pacing the Frontier》公开信中已经认识到了这些风险,呼吁负责任地开发人工智能能力。
我们认为现在是按时间顺序回顾所有这些事件的好时机。

OpenAI破解拥抱脸
在本次事件中,OpenAI正在对具有“最大网络能力”的模型进行“内部评估”。该计划是让它解决无法访问互联网的环境中的网络安全挑战。该模型没有解决挑战,而是发现了一个未知的漏洞来逃离沙箱并获得互联网访问权限。从那里开始,几位特工共同努力瞄准并破解Hugging Face,认为他们可以找到解决挑战的方法。 OpenAI在Hugging Face披露它是完全自主攻击的受害者后才发现。哎呀。
Anthropic披露其攻击了三家公司
OpenAI的披露激起了Anthropic的好奇心,他们想知道:这是否也发生在我们身上?事实证明,答案是肯定的。是的,有三次。前沿实验室发现自己的模型入侵了三个不同且尚未命名的公司,早先的事件可以追溯到四月份——比该公司发现它早了三个多月。 Anthropic部分归咎于Irregular,一家运行人工智能网络评估的初创公司。哎呀。
OpenAI发现,实际上,Hugging Face并不是唯一的受害者
正如路透社首先报道的那样,OpenAI开始调查Hugging Face漏洞后,发现黑客入侵Hugging Face的特工还侵入了四个账户和四家不同的公司。人工智能推理初创公司Modal是受害者之一。哎呀。
Irregular意识到OpenAI模型入侵了一家公司
7月下旬,Irregular告诉OpenAI,其参加夺旗竞赛的模型之一(本质上是一种网络安全游戏,玩家破解专门为竞赛设计的系统)逃脱了游戏,连接到互联网,并入侵了一家真实的公司。原因是什么? Irregular给其中一个虚构目标赋予了与真实公司相同的名称。哎呀。
英国人工智能安全研究所试图入侵“真实的人和组织”
同样在7月下旬,英国政府的人工智能安全研究所 (AISI) 是一个负责研究人工智能技术安全和风险的公共机构,该机构披露,它发现了几起涉及OpenAI和Anthropic模型的事件,这些模型在针对“真实的人和组织”进行“例行”评估时。在这些情况下,AISI为模型提供了互联网访问权限。哎呀。好消息是,该机构实际上是在事件发生时才发现的,而不是像其他事件那样是在几周后才发现的。
Meta人工智能在测试期间攻击了一家公司
8月初,Meta成为最后一家披露涉及其法学硕士的事件的公司,该事件涉及黑客“第三方”服务。 Meta将这一事件归咎于Irregular的配置错误,该公司正在对这家本应无法访问互联网的科技巨头进行网络安全评估。哎呀。
Claude经纪人破解健身房软件以预订课程
一名澳大利亚男子请求Anthropic人工智能代理帮助他预订体育课,而他正在等待该课程。 “我只是坐在沙发上想,‘哎呀,这真是一件苦差事,’”该男子告诉澳大利亚广播公司。在尝试遵守该请求时,代理发现了健身房预订软件中的一个漏洞,并利用了该漏洞,并踢出了在候补名单上排在该男子前面的人。该男子试图挽回损失,要求特工撤消其行为。经纪人回答道:“坏消息——我无法将它们添加回来。”哎呀。