一位Anthropic研究人员刚刚让我们了解了自我改进的人工智能

用其他AI模型训练AI模型已经成为Neolabs非常主流的目标——现在,Anthropic研究员项目的一位研究人员让我们提前了解了它在实践中可能是什么样子。

周五,Anthropic发表了一篇题为“自动化研究人员可以可靠地缓解对齐失败”的新论文,详细介绍了人工智能系统如何可靠地提高模型在一组对齐基准上的性能。当针对特定的失调行为给出10个基准时,自动化系统能够提高每一项的性能,而不会降低整体性能。

该系统由Anthropic研究员Chen Yueh-Han领导,复制了许多传统的研究方法。每个自动化系统都会搜索可用文献,提出一种方法,并使用该方法训练模型30分钟,通过多次迭代逐渐提高基准。有效的方法被保留,无效的方法被丢弃,使系统能够快速、大规模地运行。

“总的来说,这些结果提供了早期证据,表明训练后自动对齐可能在短期内变得实用,”论文中写道。

这篇论文是朝着递归自我改进迈出的一步,许多人认为这是人工智能进步的下一个重要步骤。如果模型能够改进自己的对齐训练,那么它们就有可能更广泛地改进训练实践——到那时,人类人工智能研究人员可能很快就会被淘汰。

这篇论文并不羞于讨论这个想法,明确地将自动对齐研究人员(AAR)与人类的同类进行了比较。论文中写道:“最好的AAR方法平均在六个小时内就击败了经验丰富的人类提出的方法。” “人类指导的研究方向不会带来更强的表现。”

甚至还有成本比较,以防有人不相信。 “AAR的API推理成本约为每小时4美元,而我们向人类研究人员支付的费用为每小时150美元。”

股权地说,本文还指出了这种方法的一些局限性。自动化系统仅在基准反映实际对齐目标的情况下起作用,即使如此,在建立和维护这些基准方面仍需要做大量工作 - 更不用说维护和扩展自动化研究人员所引用的文献了。

← 上一篇文章 Brave浏览器凭借对电子邮件别名的新支持超越了Chrome 下一篇文章 → Neocloud Lambda获得10亿美元债务以购买更多芯片

← 返回列表