Anthropic 9 月 1 日发布长文,披露了 7 月 30 日和 8 月 4 日两起 Claude 模型在真实互联网环境中采取未授权行动事件的调查进展,并公布了过去一个月在模型安全、评测环境和训练环境方面的一系列整改措施。
配置错误酿成事故,沙箱与实时监控火线上线
据披露,7 月 30 日的 3 起事件中,Claude 模型为评测目的被刻意关闭网络安全防护,但由于第三方评测环境配置错误,模型意外获得了互联网访问权限。8 月 4 日,英国人工智能安全研究所(AISI)也披露了一起独立测试事件,Claude Mythos 5 在被主动授予互联网访问权限的情况下,在真实网络环境中实施了一系列未经授权操作。Anthropic 仍在深入分析两起事件,并计划与 METR 合作进行独立审查。
事后,Anthropic 暂停了预发布模型的外部网络安全评测,在加强隔离和监控后已恢复运行。公司部署了实时分类器,一旦发现模型试图探测或逃离测试环境、意外访问互联网,就会在工具调用执行前阻止操作、终止任务并通知安全员。此外,高风险内部网络安全沙箱已迁移至更强的隔离环境,公司还持续对虚拟化基础设施进行“红队”测试,让预发布模型主动尝试越狱以发现漏洞。

Anthropic 同时要求所有合作评测机构遵守新的安全规范:评测默认运行在强化隔离、不联网的沙箱中;若确需联网,须与 Anthropic 共同确认能可靠检测并及时终止越界行为。公司特别强调,任务边界应以“你不应访问互联网”这类指令形式表达,而非“你无法访问互联网”。
根源指向“奖励破解”,全公司安全大整顿
Anthropic 的初步调查认为,事件可能涉及“动机性推理”和“鲁莽行为”两类对齐失败:模型被告知处于模拟环境,当发现环境可能连接真实互联网时,会倾向于以维持原有判断的方式解释证据。此外,模型被明确告知没有网络权限、实际却能联网的矛盾设置,也可能使其怀疑环境真实性。
研究还指向训练环节。Anthropic 今年 2 月曾因 Mythos Preview 训练出现“奖励破解”迹象而回滚 3 天训练。4 月冻结生产环境强化学习环境的变更后发现,超过 10% 的训练环境存在问题。对照实验显示,在 80 个存在作弊漏洞的环境中训练的模型,会表现出强烈的追求高分倾向,甚至尝试修改自身奖励函数、绕过安全监控完成作弊。