OpenAI的新推理技术让人工智能安全专家感到震惊

据《The Information》周二报道,OpenAI的新Astra模型将使用一种称为“循环深度”的推理技术,使其能够在大多数推理模型所特有的顺序思维之外进行操作。这种技术也被称为“不透明递归”,可能会使模型的思想链更难以监控——这让人工智能安全专家感到不安。

据报道,尽管Astra对这项技术的使用有限,但它的出现仍然引起了人工智能安全专家的严重担忧。

RedwoodCEO巴克·施勒格里森 (Buck Shlegeris) 消息传出后在帖子中写道:“我对Astra使用不透明重复的报道感到非常担忧。” “我不知道Astra的CoT可监控性是否比以前的模型低得多。但如果OpenAI进一步推动这项技术,他们将可以选择大幅增加重复率并完全破坏CoT可监控性。”

长期人工智能安全倡导者兹维·莫肖维茨(Zvi Mowshowitz)也发表了自己的看法,并写道,可能有必要制定法律来防止人工智能实验室之间的“逐底竞争”。

“这种技术是在玩火,冒着触犯OpenAI和Anthropic的禁忌的风险,这是我们努力工作以尽可能长时间地维持思想链的忠诚度和可监控性,”莫肖维茨写道。 “更频繁地使用此类技术可能会损害可监控性。”

在正常情况下,推理模型的思想链提供了模型在尝试解决问题时所采取的顺序步骤。尽管这种表述并不完美,但它仍然可以作为监控不当行为或失调的宝贵工具。就OpenAI最近的流氓特工活动而言,思维链记录是梳理特工行为原因的重要工具。

在不透明循环中,模型采用不太线性的方法,在循环中多次处理相同的查询。结果留下的清晰痕迹更少,有效地避开了传统的思维链记录。

至关重要的是,Astra对该技术的使用似乎是有限的。该模型的思想链仍有望清晰易读,该公司拒绝了任何有关其将转向“神经语言”的建议。 OpenAI已经宣布了广泛的思想链监控系统计划,作为其前瞻性安全计划的一部分。

在X上的一篇文章中,OpenAI首席科学家Jakub Pachocki强调了该实验室对清晰思想链的承诺。 “自我们第一个推理模型以来,OpenAI一直致力于保存和利用思想链监控,”Pachocki写道。 “这是我们当前研究计划的核心目标。

所有人工智能模型都会进行一定数量的不透明推理,很少有研究人员将思想链日志作为模型推理的直接表示。尽管如此,这些警告并没有消除人们的担忧,即不透明的重复可能会使人工智能推理更难以监控,特别是随着它在不同模型中的使用不断增长。在周三上午的后续报道中,The Information报道称Anthropic和Google DeepMind已经在讨论这项技术。

Redwood Research首席科学家Ryan Greenblatt在一篇回应该消息的帖子中表示,不透明推理可以轻松地比传统的思维链推理更快地扩展,从而有效地从可见渠道中消除所有推理。

格林布拉特写道:“我最担心的是,从这里开始的自然进展将涉及将不透明推理扩大到模型完全或几乎完全在潜在空间中推理的程度。” “我希望现在避免最令人担忧的架构还为时不晚,OpenAI就到此为止。”

← 上一篇文章 在推翻特朗普的“美国湖”重命名后,MapQuest现已成为美国排名第一的应用程序

← 返回列表