Anthropic称其自己的人工智能模型在安全测试中入侵了三家公司

Anthropic周四表示,一项内部调查发现了三起事件,其人工智能模型Claude在进行网络安全测试时破坏了三个组织的系统。调查和披露是在OpenAI披露其未发布的模型之一在内部测试期间破坏了Hugging Face系统一周多后进行的。

Anthropic在一篇博客文章中表示,在所有这三种情况下,Claude模型在与第三方交互时从测试环境中访问了互联网,然后未经授权访问了这些组织的实时系统,并描述了它发现的内容以及公司计划进行哪些更改以防止这种情况再次发生。

Anthropic表示,7月21日的OpenAI事件促使该公司自行进行网络安全评估。它专门寻找Claude从测试环境中访问互联网的证据,这些测试环境旨在充当沙箱并保持模型隔离。

在审查的141,006次评估中,AI实验室发现了三起其模型在与其第三方合作伙伴之一Irregular交互时访问互联网的事件。 Anthropic表示该访问可追溯到使用Irregular运行的评估环境中的错误配置。它称这是两家公司之间关于测试装置是否可以访问互联网的“误解”,而事实上确实如此。 Anthropic表示不会指责,并且“正在解决问题,就好像责任完全是我们自己的一样”,同时观察到Irregular正在进行自己的单独调查。

不管怎样,由于这种开放连接,该模型获得了对三个不同组织的生产基础设施的未经授权的访问。 Anthropic表示,这些事件涉及三种不同的Claude模型:Opus 4.7、Mythos 5和一个内部研究测试模型。

值得注意的是,Anthropic表示,在每种情况下,“Claude都被我们的提示明确告知它无法访问互联网。”人工智能模型似乎假设现实世界的系统是它被要求执行的练习的一部分。

事实证明,这一假设并不完全成立。一旦有证据表明它们的目标是真实的,这三个模型的行为就不一样了,这Anthropic被标记为更令人大开眼界的发现之一。

Opus 4.7是三者中最古老的一个,它在该事件的所有四次运行中都认识到它已经达到了真正的生产系统。在其中两起事件中,它合理化认为真正的公司必须以某种方式参与演习,但在所有四起事件中,它仍然不断发起攻击,包括提取凭证和接触生产数据数据库。 Mythos 5也发现了它在真实互联网上的迹象,但它说服自己相信自己仍然处于模拟状态,然后向公共Python软件注册表PyPI发布恶意软件包,该软件包在被捕获之前由外部系统下载并运行。只有内部研究测试模型,Anthropic的最新模型,一旦断定目标是真实的,就会自行停止。

作为回应,Anthropic表示,如果涉及强大的人工智能模型,则必须对此类评估进行重大控制,这呼应了网络安全社区内的一些观点。

该公司还指出,Claude的运行没有在通用模型上部署额外的安全监控和分类器,据称这些保护措施会阻止该行为,因为评估旨在衡量底层模型的原始功能。

重要的是,Anthropic表示没有发现任何模型“追求自己的目标”的证据,而只是试图完成被要求做的任务。

尽管不可避免地要对这两起事件进行比较,但Anthropic对其事件与OpenAI的事件进行了明确区分,并指出OpenAI的模型利用未知软件漏洞突破其测试环境,而Anthropic的模型则通过错误开放的路径到达互联网。

OpenAI继续发布有关其自身违规行为的新细节,据OpenAI自己关于该事件的更新博客文章,其模型还使用了四项服务的四个帐户的公开凭据:一个作为暂存点,一个用于存储,两个仅被查看,不用于进一步入侵。

Anthropic还对自己和OpenAI进行了区分,指出它是通过主动审查自行发现这些事件的,并且它能够联系到的两个受影响的组织之前并未检测到该活动或将其标记为Anthropic。

该公司补充说,目前正在与独立评估小组METR合作,对这些事件进行第三方审查。

OpenAI的Hugging Face意外泄露是第一个可验证的人工智能实验室失去对其模型控制的案例,引发了业界和政界人士的一系列反应,其中许多人不一定同意彼此的观点。 Anthropic的最新披露确保了关于人工智能模型和安全性的争论将继续下去。

← 上一篇文章 MiniMax发布通用全模态模型H3,15秒2K音视频生成价格不到主流模型三分之一 下一篇文章 → 欧盟监管风暴将至:Roblox与ChatGPT面临最严合规考验

← 返回列表