英伟达刚刚证明,现在真正的英雄是线束,而不是人工智能模型

英伟达周五发布了一些有趣的新研究,表明在要求人工智能执行长期任务时,工具比底层模型更重要。
tldr:只需使用经过调整的自定义工具来很好地处理内存,并包含一个“主管”boss式组件,研究人员就可以让Claude Opus 5在交互式推理基准ARC-AGI-3上获得100% 的分数。 (这个基准特别惹恼了竞争对手前沿实验室OpenAI。)在没有安全带的情况下,Opus 5的得分为30%,这是所有测试模型中最高的结果。
英伟达的研究是另一个指标,表明虽然模型选择确实很重要,就像代理的大脑一样,但它只是代理系统的一小部分,比许多人工智能用户意识到的要小,尤其是对于长期任务。线束使模型成为代理:它处理记忆、上下文和反馈。
“一般来说,世界将代理几乎解释为模型的API,”Nvidia人工智能部门产品副总裁Adel El Hallack(如上图所示)告诉TechCrunch。但代理人的作用实际上不止于此。 “它是模型。它是模型周围的脚手架,我们称之为工具,即它使用的工具集。它是运行时以及我们为其提供访问权限的相关技能和库。”
长期任务是那些需要将许多决策串联在一起(有时需要数天)才能完成的工作。这与人工智能只是对提示做出响应形成鲜明对比。弄清楚如何让人工智能在不分心和陷入困境的情况下完成长期任务,是代理研究的圣杯之一。
例如:微软在4月份发布了一项研究,测试了19名法学硕士涉及文档编辑的长期任务,发现所有模型,包括前沿模型,都在文档中充满了错误。 (如果人类做出这样的工作,他们会立即被解雇。)
自行做出决策的模型也被发现删除用户的文件,甚至整个数据库,或者转向犯罪行为以实现从共谋到黑客攻击的目标。
Nvidia研究人员选择使用这个交互式推理基准进行测试是特别有意义的,几乎是有趣的。这是一堆没有说明的2D游戏的基准测试。该模型必须弄清楚如何玩游戏并获胜。 100% 的分数意味着该模型可以像人类一样击败游戏。
OpenAI对其模型在ARC-AGI-3上的糟糕得分(低于10%)感到非常慌乱,以至于上个月进行了自己的研究。与Nvidia一样,OpenAI发现只需调整安全带上的两个设置,其模型的得分就会增加两倍。
但没有一个模型能够像Nvidia的研究人员那样接近100% 的分数。他们表明,安全带需要一个“监督者”组件,当智能体卡住时,该组件可以促使智能体朝正确的方向前进。
“更有趣的部分是,除了负责这项工作的主要代理人之外,还引入了一名监督代理人,”埃尔哈拉克说。它“几乎就像CEO一样,当代理偏离方向或开始探索一条可能导致死胡同的路径时,或者重新探索它以前走过的路径时,就会推动它。”
虽然监督代理的概念并不新鲜,但如今大多数代理用户只依赖一层来使用他们的工具,例如Claude Code、Codex、Hermes等。Nvidia研究人员创建了他们自己的增强工具,称为代理变量操作符 (AVO)。
请注意,这不是Nvidia的新产品。相反,Nvidia生产了大量用于构建Nemo品牌线束的开放技术。其中一些技术是商业化的,许多技术是公开可用的。
尽管如此,英伟达的结果进一步证明,模型选择远非影响代理性能的唯一因素。例如,7月,Databricks发布了一些令人惊叹的研究,表明该工具比模型更能极大地影响人工智能成本。
DatabricksCEOAli Ghodsi告诉TechCrunch:“您可以选择相同型号但不同的线束,如果使用错误的线束,您的成本会显着增加。” “所以你会想,哦,这是一个昂贵的型号。这是一个便宜的型号。但是等等,你使用哪种安全带?它本身可以使你的成本增加两倍。”
Nvidia更重要的一点是要表明,开放式安全带就像开放式模型一样,让用户的控制力远远超出他们的想象。
“我们相信,而且我们正在通过生态系统来演示,开放式安全带如何让您能够转动更多旋钮来提高准确性,”El Hallack说。 “这与OpenAI减慢模型训练有关”,因为模型造成了安全漏洞。
他补充道:“我们相信,拥有一个开放的代理堆栈——您可以在其中跨线束、跨基础设施、跨运行时进行控制——是我们引领生态系统安全向前发展所必需的。”