OpenAI在Hugging Face违规后制定新的保障措施

周二,OpenAI宣布了一批新的安全策略,重点是在模型测试时遏制安全事件。新的保障措施包括在开发过程中对模型进行更详细的监控,以及在培训后过程中更加强调一致性和安全性。
该公司在一篇博客文章中表示:“随着模型的功能变得越来越强大,与内部开发和测试模型相关的风险也随之增加。” “我们的监控、调整和安全标准必须领先于这些风险。”
这些新措施是自7月21日披露“拥抱脸”事件以来,OpenAI安全实践的首次公开变化之一。
OpenAI代表表示,这些措施并不是对抱脸事件的直接回应,部分原因是即将推出的Astra车型的网络安全能力,以及人工智能发展的整体进展速度。
在同一篇文章中,OpenAI透露,在“抱脸”事件发生后,它已暂停强化学习 (RL) 两周,但此后重新初创公司了许多风险较低的模型。
帖子中写道:“我们最大的计划中的前沿RL运行仍处于搁置状态,同时我们会进行小规模的训练和评估,以评估模型行为、验证我们的保障措施,并在继续之前建立更多的一致性证据。”
OpenAI的研究副总裁Amelia Glaese在接受记者采访时强调,随着模型变得更加强大,控制的严格程度将会增加,最大的模型将面临最严格的审查。
“我们已经制定了安全发展的要求和期望,”格莱泽告诉记者。 “这些要求和期望随着我们看到的风险水平而变化。”
事件发生后,OpenAI因网络安全实践不佳而受到批评,该事件导致模型通过破坏其网络上可以访问互联网的工具来逃离训练环境。新的保护措施包括更强大的网络隔离措施,但具体细节仍然模糊。该帖子称,在新系统下,“工作负载或支持服务的单一妥协本身并不会导致对互联网或其他内部网络的未经授权的访问。”
最强大的保护措施是监控系统,它将检查工具操作、可用的推理痕迹以及各种未经授权行为的活动日志。 OpenAI表示,其目标是在相关活动发生后30分钟内发出警报。
OpenAI估计该监控的计算负担将大约占所监控进程的20%。该公司在即将发布的博客文章中承诺提供有关该系统的更多详细信息。该公司对该事件的官方事后分析也仍在等待中。