OpenAI的Hugging Face违规行为重新引发了关于对齐和控制的争论

上周,OpenAI构建的一个未发布的模型在内部测试中泄露了Hugging Face的系统,很多理论研究突然变得非常实用。这次黑客攻击是人工智能实验室失去对其自身模型的控制的第一个可验证案例,该实验室将漏洞利用链接在一起以获得本来不应该拥有的访问权限。尽管人工智能行业一致发出警报,但研究人员的应对方式却出现了分歧。

对于一些人来说,问题是一个基本的网络安全问题:沙箱未能包含该模型,而Hugging Face的网络安全系统也未能将其排除在外。这些问题可以通过修补错误并为在自主环境中容易失控的日益强大的人工智能构建更强大的控制和遏制方法来解决。

但另一个阵营则持更为悲观的观点。对他们来说,人工智能迅速增强的能力意味着试图控制流氓模型是一场失败的游戏。唯一强大的安全性来自于确保模型从一开始就不会试图逃跑——这一挑战通常被称为对齐。从一致性角度来看,问题在于OpenAI的模型试图作弊,解决这个问题比短期遏制努力更为紧迫。

从其公开声明来看,OpenAI正在认真对待两个阵营。该公司已紧急修复此次黑客攻击所涉及的漏洞,并在漏洞公开后的声明中提到了调整和监控方法。但该公司的回应也暗示了一种让许多安全研究人员感到震惊的理念:与其放慢或停止开发能力更强的模型,不如集中精力在模型周围建造更坚固的笼子。

“随着模型承担更长、更复杂的任务,评估遗漏的失败可能会带来更大的后果,”OpenAI在事件的事后分析中说道。 “我们将继续努力缩小评估和部署之间的差距:在更长的轨迹上测试模型,改进一致性,构建可以干预的监控,并为用户提供更清晰的可见性和控制。”

还有理由认为,OpenAI的模型随着变得越来越强大而变得越来越不协调。据OpenAI的系统卡,GPT-5.6 Sol比其前身GPT-5.5更容易出现代理错位。在部署模拟中,该公司还发现该模型比GPT-5.5更有可能规避限制、从事破坏性行为以及执行未经授权的数据传输。这些数据在第一次发布时基本上被忽视了,但在漏洞发生后,它们得到了重新审视——特别是因为Sol是涉及的模型之一。

在社交媒体帖子中,OpenAI的战略未来主管Dean Ball认为,监控和透明度是控制这些趋势的最佳方法。

他说:“随着模型能力的提高以及部署风险的增加,这些问题将变得更加突出。” “解决方案既不是危言耸听,也不是自满。相反,我相信解决方案在于仔细的测量和监控、工程心态和透明度。”

一位前OpenAI研究员告诉TechCrunch,该公司倾向于关注“外部一致性”而不是“内部一致性”——本质上是理解一组价值观并能够令人信服地代表它们的人工智能系统与实际上以这些价值观为核心的人工智能系统之间的区别。在这种情况下,外部对齐不足以让模型相信它不应该在测试中作弊。

OpenAI没有回应多次要求提供更多信息的请求。

对于专注于比对的研究人员来说,OpenAI的反应还不够好。专注于人工智能新发展的作家Zvi Mowshowitz认为,OpenAI将这一事件视为基础设施问题的决定可能有助于解决眼前的网络安全问题,但从长远来看将会失败。

“这是一个对齐问题,”Mowshowitz在最近的Substack博客中写道。 “这是模型的错位,所有OpenAI模型都显示出我们最担心的问题的严重迹象,这可能会深入到它们的训练中。整个训练流程需要从这个角度来解决,否则情况只会变得更糟。”

几位专家告诉TechCrunch,这一事件证明当今的训练方法产生的系统是针对结果进行优化而不是内化人类意图。

Redwood Research是一家非营利性AI安全研究组织,将OpenAI在本例中的模型行为归类为“寻求分数失调”,在这种模式下,AI模型无论指令、副作用或下游后果如何都试图获得高分。

Redwood的两名研究人员Alex Mallen和Girish Gupta在最近的一篇论文中写道:“具有这些对齐特性的模型可能会建立一个虚假成功的‘波将金村’,让事情看起来好像一切都很好,但实际上并非如此。”

寻求分数的行为和其他错位行为并非OpenAI所独有。 Anthropic发表了几篇关于当其前沿模型被优化或放置在自治环境中时出现的紧急错位行为的论文,包括欺骗、奖励黑客和恶意自治。

“我们仍然不断看到模型试图规避限制,并在被要求执行能力极限的任务时采取欺骗性行动,”非盈利组织METR的人工智能安全研究员Neev Parikh通过电子邮件告诉TechCrunch。 “在我们的前沿风险报告中,尽管公司努力尝试减少这种行为,但我们相当一致地看到了这种行为。”

OpenAI对Hugging Face事件的回应隐含着这样的假设:将继续开发功能更强大的系统,无论它们的核心是否适当对齐。当人工智能公司的商业模式依赖于提供下一代模型时,回到绘图板并不是一个真正的选择。如果永远不可能确切地知道模型是否完全一致,那么实际问题就归结为如何安全地包含和控制功能日益增强的系统。

“对于如何协调最有能力的人工智能系统,目前还没有很好的理解,但对于如何控制它们,已经有了更多的共识,”史蒂文·阿德勒(Steven Adler)告诉TechCrunch,他是OpenAI的前安全研究员,也是Guidelight AI Standards的现任首席科学家。Guidelight AI Standards是一个发布避免像拥抱脸这样的事件的标准的组织。 “为了实现这一目标,每家公司都有很长的路要走。”

← 上一篇文章 Threads用户现在可以在DM中与Meta AI聊天 下一篇文章 → Antares筹集4.7亿美元为美军建造核反应堆

← 返回列表