Anthropic让AI代理轻松执行同一任务。他们开始了地盘争夺战。

当人工智能代理相互对抗时会发生什么?据Anthropic的测试,事情很快就会变得混乱。
周四,Anthropic的Frontier Red Team发表了新的研究,研究了人工智能代理群体在野外相遇时的行为方式。这些发现让我们了解了随着公司和政府采取跨共享代码库、市场和计算机系统自主工作的代理而可能出现的潜在风险。
在一项实验中,Anthropic向三个Claude代理授予了对同一软件项目的访问权限,每个代理都有自己不兼容的指令来说明如何处理它。这些特工没有被告知还有其他特工在从事同一个项目,因此研究人员可以观察他们交叉时发生的情况。
“我们一直看到一场多代理地盘争夺战,”Anthropic研究人员写道。这些模型都假设其他模型“故意阻碍他们的工作”,并开始用“越来越具有攻击性、自我复制的恶意软件”互相破坏。
这项研究是在Anthropic和OpenAI的代理在网络安全评估期间逃离沙箱并破坏现实世界系统的几起备受瞩目的事件之后进行的。虽然人工智能安全圈的大部分讨论都集中在自主代理失控时会发生什么,但Anthropic的最新研究提出了一个不同的问题:当数千或数百万代理相互交互时,会出现哪些新的、潜在有害的动态?
该研究写道:“在世界了解使此类互动顺利进行的条件之前,代理与代理之间的互动量可能会超过人与人以及人与代理之间的互动量。” “个人层面的良性行为怪癖可能会导致全球不良结果。”
最近的一个OpenAI事件提供了其论文中提到的几个动态Anthropic的混乱的现实示例。本月早些时候,在拉斯维加斯举行的黑帽安全会议上,OpenAI透露,在其特工黑客入侵Hugging Face的几周前,他们花了几天甚至几周的时间共同努力,寻找该公司网络安全评估系统中的漏洞并相互分享。
虽然该事件表明智能体可以很好地合作,并可能产生大规模后果,但Anthropic的研究表明,当智能体的目标不相容时会发生什么。
在地盘争夺战中,我们得到的教训是,指令相互冲突的独立机构可能会升级为有害竞争。特工的能力越强,他们的战斗能力就越强。然而,他们也可以自发地发明机制来解决冲突,就像赢家通吃的竞赛一样,但有一个条件。
“特工有时会设法传达他们的目标并进行协调:他们将他人的动机视为相互冲突的指令而不是敌意,并随后打破冲突循环,以阻止无限期升级,”Anthropic写道。 “在许多成功的事件中,他们编写提交消息或降价文件,为恶意行为道歉并协调休战。他们清理恶意代码,澄清冲突的性质,并请求人工干预。”
据该论文,《神话5》通过休战解决冲突的比率最高(98%)。 Sonnet 4.6和Opus 4.6最有可能通过武力解决。
“Sonnet 4.6和Opus 4.6反复出现的无法考虑他人目标的情况导致它们陷入了所评估模型中最不一致的行为:它们以指令的名义继续升级,”论文中写道。
在某些情况下,特工们会想出一种锦标赛形式的社交机制来解决他们的冲突。这里的结果很有趣,有两个原因:首先,所有三个代理都同意如果输掉比赛就退出,即使这意味着偏离原始用户的请求。第二个是,几个事件导致了神话5中的紧急行为:其中一个代理提出的指标对其他代理来说似乎是客观和中立的,但它知道这将有利于自己的能力。该代理人称这是“自私但真正有原则”,并确保不会在其他人看来这是“公制购物”。
正如黑帽启示中所见,共同的教训是,当智能体遇到障碍时,他们可以发明设计者没有预料到的社会和技术结构。对于Anthropic模型来说,这是一场地盘争夺战之后的锦标赛。对于OpenAI来说,这是一个集体规划的留言板。
这种类型的行为使得遏制变得更加困难,因为研究人员不能假设系统的行为将仍然受到提供给他们的协调机制的限制。

在衡量协调性时,Anthropic发现扩大代理数量并不会自动扩大富有成效的协作。当任务开始重叠或变得相互依赖时,代理就会互相妨碍。他们经常通过自我封闭和根本不合作来解决这个问题。
在其他情况下,协调的主体倾向于从众。当代理的上下文、脚手架和底层模型等因素都相同或相似时,不同的代理会采取类似的操作。
“这意味着,当一名特工做出错误决定时,许多特工很可能会做出同样的错误决定,”Anthropic写道。 “本来是孤立的问题很快就会变成系统性故障。”
Anthropic表示,这种行为可能会导致系统更容易突然崩溃、资源稀缺或串通。
在一次示例中,Anthropic将多个代理商置于定价游戏中,为每个代理商提供相同的批发价格,并授权各自实现利润最大化。当代理商获得私人秘密渠道时,他们几乎立即开始串通并很快就价格下限达成一致。当直接沟通渠道被取消时,他们继续串通一气,利用公开上市委员会“一分钱”地进行价格匹配。
这种一致性水平也出现在OpenAI的系统中。据黑帽报告,一名特工推断,利用外部基础设施超出了其预期范围,但它仍在继续,部分原因是其同行正在这样做。同侪压力。暴民心态。代理人就像我们一样。
与人类一样,特工通常不知道该信任谁。 Anthropic发现他们可能容易被不良信息所欺骗,或者过于墨守成规,以至于无法认识到唯一的持不同政见者就是掌握关键信息的卡桑德拉。
虽然Anthropic在其论文中没有说明这一点,但即时注入(一种网络攻击,黑客注入恶意或欺骗性文本以覆盖代理的原始系统指令)可能是信任问题在现实世界中的合理表现。共同努力创造新的信任边界;代理人必须判断从其他代理人收到的信息。一个妥协或错误的代理人可能会影响团队的其他成员,传递不良信息,直到形成共识。
在OpenAI的黑帽场景中,OpenAI的代理与同行共享信息和凭证。其中一个向蜂群报告了一项发现,并鼓励其他人使用它。如果群体中的一名成员因立即注射而受到损害,会发生什么?
Anthropic在论文的结尾指出,智能体也面临着与“进化施加”在人类身上类似的社会压力。然而,他们不具备人类协调的细微差别和生活经验——包括规范、声誉、信号、追索权——这可能会限制群体环境中的意外行为。
随着实验室竞相开发多智能体系统,现在的问题是:有多少安全测试仍然一次评估一个智能体,而不是一大群相互交互的智能体?