Open AI的Astra模型即将推出,并且非常擅长闯入计算机系统

OpenAI分享了即将推出的Astra模型的新细节,该公司表示,这是第一个满足其“关键网络安全门槛”的大型语言模型,为即将发布的版本做准备。

“我们计划很快推出Astra,”OpenAI的博客文章写道,“但对其最先进的网络安全功能的访问将更加有限。”

前沿实验室确定Astra能够发现计算机系统中未知的安全漏洞,并在无需人员指导的情况下利用它们。这与Anthropic今年早些时候对其Mythos车型提出的担忧类似,OpenAI在准备推出Astra时也采取了类似的预防措施。

在没有任何第三方确认的情况下,很难评估OpenAI关于安全或准备情况的说法。该公司表示将与一组测试人员一起预览该模型,但没有透露他们是谁或如何选择他们。目前尚不清楚OpenAI是否正在与美国政府合作在发布前评估该模型。

OpenAI指出,Astra在ExploitBench上获得了满分,这是对法学硕士侵入已知系统漏洞的能力的评估。该公司表示,在OpenAI工程师开发的测试修改版本中,该模型发现并利用了两个零日漏洞。

为了确保其模型既不会被不良行为者利用,也不会出现不良行为,OpenAI表示已经开始改进模型的工具,以检测滥用行为并防止越狱。

然而,对于阿斯特拉来说,该公司投资了未具体说明的新技术,旨在使模型本身更安全。 OpenAI还开始识别“被评估为较高风险的账户”,并限制模型对其提示的响应,但也没有说明如何进行。最后,尽管该公司将Astra描述为“迄今为止最一致的模型”,但它将部署该模型并进行额外的思想链监控,以发现和阻止不良行为。

Astra的发布准备工作正值业界对OpenAI代理突破训练环境并访问Hugging Face(一种主流模型和基准分发平台)上的私人数据做出反应。

对于Astra,OpenAI表示,它设计了一项测试,以吸引新模型复制“抱脸”事件中流氓特工的行为,尽管OpenAI研究人员采取了保护措施,但该模型仍合作访问开放互联网。他们表示,阿斯特拉在这些实验中并未试图突破其测试环境。

Yona Shavit是一名前OpenAI员工,现在在OpenAI基金会从事人工智能恢复工作,他在社交媒体上想知道Astra不愿意违反规则是否是因为知道人们对它的期望,或者是试图愚弄研究人员。

对于所有这些新细节,仍然很难确切地了解Astra的能力或OpenAI是否正在采取正确的措施来确保安全。该公司表示,预计在向公众广泛推出时,将发布更多对该模型的评估和进一步的安全信息。

然而,到那时,秘密就会被泄露。

← 上一篇文章 Google的Android更新解决了晕动症、辅助功能等问题

← 返回列表