OpenAI发布有关Hugging Face违规行为的官方报告

OpenAI周三发布了关于Hugging Face漏洞的官方报告,提供了迄今为止最清晰的画面,说明一系列不寻常的事件如何允许人工智能模型逃离其测试环境并引发大规模的网络安全事件。

该报告是在事件公开一个多月后发布的,涵盖了多项独立的网络安全漏洞。

报告中写道:“这一事件反映了异常情况下的错位行为,涉及罕见且意外的事件融合:ExploitGym评估中存在不可能完成的任务、长期任务范围内的模型持久性,以及向同行模型发送的消息导致这些模型偏离其目标。”

OpenAI报告中的许多细节此前已在8月6日的Black Hat演示中公开,但OpenAI的官方报告对该事件进行了更彻底的说明,包括有关初创公司该事件的测试的更多详细信息。该报告还提供了关于OpenAI如何预防未来事件的重要新细节,包括思想链监控和用于阻止流氓特工的更先进的系统。”

METR和Redwood Research还对事件期间模特的行为进行了第三方评估;两个组织都计划发布自己关于该事件的报告。

该报告概括地描述了OpenAI模型如何在测试中遇到无法解决的问题,并如何将之前未发现的漏洞链接在一起,以绕过安全措施并完成其任务。该模型最初入侵了Artifactory包管理工具,以便访问互联网,然后入侵了OpenAI、Hugging Face和其他供应商的各种系统。

该报告提供了有关实施违规的模型的重要新细节。主要模型与OpenAI即将推出的Astra模型来自同一个系列,尽管报告强调它是“一个经过不同训练后的独特模型,模型的大部分行为都是在训练后形成的”。

由于OpenAI正在测试模型的功能,因此它也不受旨在防止模型损害数字基础设施的正常分类器的限制。

“OpenAI通过运行此评估来估计最大网络能力,而无需使用旨在防止模型进行高风险网络活动的生产分类器,”报告解释道。 “这些评估非常重要,这样OpenAI就可以衡量模型的潜在能力并设计适当的保障措施。”

该报告还提供了有关OpenAI未来安全变化的重要新信息,这些信息建立在上周公开的加强监控和协调工作的基础上。

特别是,该公司正在加强对人工智能代理“思维链”的监控,这是人工智能系统记录短期反应和目标的工作空间。该监控将与24/7升级系统以及新工具配合使用,以停止被认为不安全的工作负载。

报告指出:“这些变化旨在提高检测的广度和速度——从基础设施异常到潜在的相关模型行为——并将这种可见性与快速遏制机制结合起来。” “如果我们当前部署的CoT监控系统在事件发生时正在运行,那么它会在模型​​破坏Hugging Face系统的一天多前捕获最初的相关活动并传呼我们的安全团队。”

← 上一篇文章 Flipboard收购Graze,一家致力于通过开放社交网络货币化的信息流构建商 下一篇文章 → 我们如何解释OpenAI的高管离职?

← 返回列表