OpenAI is building AI agents for everything. Will everyone use them?

您愿意让法学硕士对您的数字生活有多大的控制权?
从模型中获得最大价值意味着给它钥匙。对于控制狂或对人工智能犹豫不决的人来说,这似乎很多。对于OpenAI桌面应用程序的首席工程师Andrew Ambrosino来说,这是测试未来的唯一方法,这就是为什么该应用程序现在可以访问和控制他的收件箱、他的Slack帐户、他的手机、Notion和Figma等应用程序等。
“如果我要求它写一份文件,它是否有可能从有关该主题的私人DM中获取信息,而不知道它不应该共享一些信息?是的,”Ambrosino告诉TechCrunch。 “我会为了这份工作而这样做。如果有必要的话,我会在这里或那里承受个人的打击。但我没有必要这么做。”
Ambrosino致力于OpenAI最大的赌注,ChatGPT Work,该产品于上个月发布,可在该公司的最低订阅级别上使用,每月20美元。该产品旨在让白领员工能够部署人工智能代理——将法学硕士与会计师、投资者、医生和其他日常工作由计算机控制的人使用的数字工作流程连接起来。
OpenAI的营销文案简洁地阐述了目标:在这个世界中,“[人工智能] 不仅仅是回答问题,而是帮助每个人将他们最伟大的想法变成现实。”
对于软件开发人员来说,这种转变已经发生,但蔓延到其他部门的速度很慢。 ChatGPT Work是该公司Codex编码工具的修改版本。它的目的是为非工程师提供与软件工程师从代理那里获得的相同功能的版本:一种人工智能工具,不仅可以回答问题,还可以自行完成多步骤项目。
“在这个新因素中,ChatGPT实际上可以以一种愉快且安全的方式自主地为大家完成整个、非常复杂的任务,”领导OpenAI核心产品工作(包括Work)的Thibault Sottiaux告诉TechCrunch。 “这就是OpenAI的使命——带动所有人。”
从商业角度来看,这非常重要。工作时间较长的代理会消耗更多代币,这使得它们在每个用户的基础上为OpenAI带来更丰厚的利润。进入新的职业至关重要——不仅对OpenAI如此,对整个行业也是如此。如果事实证明,编码对于人工智能实验室来说是利润丰厚的领域,但如果这些公司要证明其在培训和计算方面的巨额投资是合理的,那么它仍然只是人工智能工具所需实现的专业工作的一小部分。虽然实验室一直专注于软件工程师,但Harvey(法律领域)和Clay(销售领域)等特定垂直领域的竞争对手一直在采用与模型无关的方法来追逐这些客户,这意味着他们将插入当时效果最好的人工智能。
行业分析师认为这是OpenAI及其竞争对手面临的主要挑战之一。 Christian Cataliniwroteon a16z的博客“是时候构建了”:“如果实验室无法迅速获得在市场上扩展人工智能所需的关键补充资产,价值就会在其他地方累积。”
让人工智能应用程序为非软件工程师的人工作需要更多的帮助。 OpenAI的非工程人员,如通信和财务团队,开始使用Codex“是在Codex对他们充满敌意的时候——向他们询问代码并向他们展示,‘哦,你对这件事有一个空的差异,’”Ambrosino说,指的是用于软件更改的技术读数。 “所以,从二月份到现在,我们开始让它变得更加通用。”

一项OpenAI支持的研究发现,6月份,98% 的OpenAI员工使用Codex,但只有17% 的组织订阅者和不到1% 的个人订阅者使用代理编码工具。公司内部几乎全部采用和外部微乎其微的采用之间的差异对公司来说是挑战和机遇。“我们为用户创造的价值和效用越多,他们就越愿意为部分效用付费,这也是我们一直以来所看到的ChatGPT,”Sottiaux说。 “你坐在那里,心想,‘我当然愿意每月为此支付20美元’,因为你获得的价值要多得多。”
如何让人工智能变得直观
要理解这种脱节,有助于了解OpenAI的工程师正在构建什么。每个法学硕士都需要工程师所说的“工具”——包裹在模型周围的软件,决定它看到什么信息、可以使用哪些工具以及如何向你呈现答案。
如果你希望该模型做一些事情——成为一个代理——该工具会为它提供工具和说明,以便在长期任务中使用它们。对于开发人员来说,支持法学硕士进行编码的命令行界面 (CLI) 足以改变软件的构建和部署方式。但大多数人并不使用CLI;而是使用CLI。 Windows取代DOS是有原因的。
Ambrosino告诉TechCrunch,一个超越软件工程的代理产品“将成为与你生活中混乱的世界以及1995年构建且从未更新的工具和网站一起玩的东西”,并解释说他的团队正在构建的体验对于扩大对有用人工智能的访问至关重要。
考虑像Claude Code和Codex这样的应用程序:它们通过抽象出所有实际的软件编写来释放“vibe编码”,并让用户只需告诉模型他们想要在程序中做什么。现在,OpenAI希望让OpenClaw等工具中的功能像提示一样简单,程序员可以使用这些工具让法学硕士投入工作。
安布罗西诺说:“如果没有模型中的这些产品,专家们就会知道如何获得相同的结果,但你不会让十亿人使用这个东西。”高级用户的需求和主流采用的需求之间的权衡在OpenAI的内部辩论中展开,一些员工认为,如果用户可以直接询问模型,则不需要按钮。
“我们反对这一点——因为现在还为时过早,”安布罗西诺说。 “在这个阶段,可发现性很重要,但在某些时候我们不会有这个按钮。”
Work还有一些用于选择项目和插件的按钮,但它的目标是与其他OpenAI产品相同的魔盒界面。他将其与拟物化进行比较,拟物化是一种逐渐消失的做法,即让数字工具看起来像它们所取代的物理对象,就像计算器应用程序看起来像袖珍计算器一样。 “这些东西不仅仅是令人畏缩的设计。这实际上帮助人们进入这个领域并实现过渡,”安布罗西诺说。
OpenAI不会透露有多少人使用Work和Codex,但该联合应用程序的使用人数仅为2000万人,而该公司表示正在推动ChatGPT在线使用超过10亿用户。
授予ChatGPT技能许可
目前,OpenAI认为该工具最适合日常的数据密集型协调任务。例如,其员工正在设置每周指标报告,并将电子表格制作成规划工具。
我曾与风险投资家交谈过,他们使用代理将有关公司的相关沟通和分析汇总到投资备忘录中,并让运营团队初创公司定制的仪表板和数据可视化。山姆·奥尔特曼正在用它来计划他的假期。一位OpenAI工程师描述了要求程序查看有关工程问题的Slack对话并“制作一些图表”,然后收到一系列富有洞察力的图表。
“对于这些公司的普通工人或员工来说,包括我自己,都存在大量信息,”OpenAI产品工程团队的领导者Akshay Nathan说道。 “实际上,我们解析可用的所有内容并对其采取行动的能力非常有限。这些信息存在于所有这些系统记录工具中(例如Salesforce)……ChatGPT的价值在于您已经可以访问这些信息,但现在您真正可以访问它了。”
那么,这可能是人工智能布道者梦想的数字个人助理。与Claude Cowork或Perplexity AI浏览代理一样,ChatGPT Work将代理链接到您现有的工作空间(电子邮件、网络浏览器、大量SaaS平台),并让该环境为您工作。
当系统工作时,它可能会令人印象深刻:我要求ChatGPT工作,从我的电子邮件中取出我儿子格式奇怪的学前日历,并将其放入我的Google日历中,它做到了,为我节省了大量重复的数据输入。希望现在我不会忘记学校聚餐或未能安排假期托儿服务。
我不信任OpenAI可以访问我的收件箱、来源访谈或故事草稿(不要害怕,人工智能仇恨者),也不会让它访问我的银行账户,但我相信如果我有信心的话它会更有用。我要求它对我所研究的上市公司进行财务分析,它为我提供了一个自动更新的指标仪表板;它创建了一个可查询的太空发射数据库,这是我以前必须通过编写Python脚本来完成的任务。它还每周向我发送一封电子邮件,介绍学术交流中心发布的新人工智能研究。我会继续尝试。
虽然向模型询问某些信息很直观,但向模型提供采取行动所需的信息却并不那么简单。为代理设置访问云驱动器的权限是令人困惑和循环的——我多次尝试只授予它“读取”访问权限,但收到了错误消息。该模型本身并没有太大帮助,但最终在移动应用程序上,弹出一个对话框告诉我只有完全访问才能使其工作。
许多重要的设置只能在网络应用程序上使用,因此我经常发现自己同时在这两个应用程序中工作。有时,ChatGPT Work的限制令人困惑 - 将其链接到您的Google日历,它可以创建事件,但不能创建新日历。除非努力水平很高,否则不要费心去尝试做任何事情,否则你会遇到你共事过的最糟糕的实习生。
这是人工智能早期采用者的常见建议,他们担心沮丧的新手会放弃。 OpenAI安全带的工程主管Joe Gershenson承认,对于新用户来说,工作量设置还不够直观——“我们可以做一些更好的事情来帮助他们获得正确的推理水平……”他补充道,“留意这个空间。”
OpenAI面临着进入普通白领工作的另一个重要挑战:大多数工作流程不像代码那样可衡量或可评估。软件要么能工作,要么不能工作,甚至这种区别也减少了代码好坏的细微差别。良好的演示、业务策略或销售宣传并不那么容易评估或追踪。
“像这样的产品面临的独特挑战之一就是它真的可以做任何事情,”安布罗西诺说。当我询问团队设计围绕哪些具体问题以及针对哪些工作流程时,与我交谈的工程师表示反对,说这是OpenAI研究团队的问题。
OpenAI后来给出了答案,告诉TechCrunch它使用了来自44个职业和数百个知识工作测试的基准GDPval,并用用户反馈进行了补充。一个不太官方的答案是,它来自OpenAI员工自己。安布罗西诺说,“我们必须始终分析……我们是否在做其他人都会做的工作流程,或者我们是否很奇怪?”
应用程序本身的早期采用者将据实际使用情况创建有价值的痕迹——编码工具的成功很大程度上建立在类似的数据收集之上——假设他们不选择不将其用于培训。 (我做到了)。
推动OpenAI产品设计的竞争
尽管所有的注意力都集中在模型界面上,OpenAI的工程师却不愿意回答一个相当简单的问题:是什么让Codex和ChatGPT Work与Claude Cowork或其他面向大众用户群的竞争性代理安全带区分开来?回答。 “广告狂人‘我根本不想你’这句话浮现在脑海中。”
坦率地说,我不相信他们,如果仅基于产品用户界面之间的极端相似性、任何企业对竞争情报的需求,以及因为ChatGPT Work在我初创公司时要求我做的第一件事就是移植我的Claude Cowork数据。
如果Claude代码是OpenAI办公室的敏感话题,这是可以理解的。他们的企业竞争对手定义了人工智能编码市场,并对软件工程师的工作方式发起了一场革命。这也令人沮丧,因为OpenAI首先有了这个想法,但没有完全正确地利用它。
When OpenAI first developed Codex as a web app, the engineers got a bit over their skis — or, as Ambrosino puts it, “a bit more AGI-pilled.”简而言之,他们押注该模型足够智能,能够完全独立处理任务,并且用户输入最少。
此后不久,Claude代码就以与用户的来回对话为导向。如果你给它一个问题,它会调查可能性并为你提供三到四个继续的选项。一旦你选择了,它会走得更远,然后再次检查,提供持续更新,并为模型和线束留下更少的犯错空间。
Anthropic的方法被证明更有效,即使它需要用户做更多的工作。 “[我们的]产品比当时的模型和安全带稍微领先一些,”安布罗西诺现在说道。
OpenAI最终也效仿,为用户添加了更多与模型交互的机会。这就是我们今天所知的法典,包括桌面和移动应用程序。使用下载统计数据作为对程序兴趣的代表,直到今年4月,Claude Code的需求量才更大,但现在Codex已略微领先;企业使用调查也表明OpenAI正在迎头赶上。
这一领先优势的部分原因在于产品与市场的契合度,部分原因在于对Anthropic模型安全限制和计算短缺的抱怨。 OpenAI在ChatGPT工作中继续迈向以人为本的安全带,但我采访过的工程师坚持认为,关键的区别在于OpenAI最新的强大且具有成本效益的模型的优势。
“令人沮丧的答案是,很多时候是模型的问题,而我们试图用这个应用程序做得很好的一件事就是充分利用模型,”安布罗西诺说。
无论如何,什么才是好的安全带?
这种解释又回到了人工智能研究人员得到的“惨痛教训”,即更好的通用模型比特定领域的经验更重要。对于真正的信徒来说,挽具只是暂时的拐杖,而不是护城河。
“通过添加一大堆额外功能(if、then和工具),您可以在短期内获得良好的结果,但是,来吧,下一个模型将在几个月内问世,从而使这些变得过时,”Gershenson告诉TechCrunch。他的团队专注于以最简单的方式将模型暴露给其所需的工具和上下文,仅此而已。
“良好的线束工程的目标是……更准确地了解模型真正需要哪些信息来解决您的问题,因为如果您只是让它们做自己的事情,那么模型就会变得越来越好,”格申森说。
不过,还有一个悬而未决的问题是,大多数人或模特是否已经做好了准备。研究工作场所人工智能工具的沃顿商学院教授伊森·莫里克 (Ethan Mollick) 仍然认为Claude更加用户友好,他写道,“ChatGPT倾向于变魔术,只是为你做,而Claude则进行比较和展示,反复要求输入和反馈,并进行A和B测试。”
Sottiaux,或许还有OpenAI普遍不同意,他们认为应用程序的对话性质比学习如何使用应用程序更好。 “我们确实看到世界似乎已经准备好了,”他谈到这款应用程序时说道。 “这就是为什么我们得到了令人难以置信的采用。”
尽管如此,目前还不清楚特定于模型的安全带是否是最大化模型的正确选择。 Composio和Databricks等公司进行的比较表明,不同的工具和模型组合在编码基准上提供不同的性能。 Databricks发现,软件公司Earendil发布的开源工具Pi在使用相同的GPT 5.5模型时,性能优于Codex。 Pi已用于构建OpenClaw和Cloudflare OS等项目。
Pi的创造者Mario Zechner表示,他故意设计的极简主义工具证明了AGI填充的方法是可行的,至少对于软件工程师和编码任务来说是这样。他说,它缺乏明确的功能,但可以通过其自我修改和构建自己的界面的能力来弥补。他对OpenAI的工程师在将用户群扩展到工程师之外所面临的挑战表示同情。
“一切都是编码代理塑造的……原因是他们只有编码代理任务的训练数据,”他告诉TechCrunch。 “假设我在管理层,我今天做出决定,结果会在几个月后发生。你无法通过用户和代理来回的简单跟踪来捕获这一点,因此所有这些类型的任务以及任何未数字化的内容都无法通过模型进行学习。”
与其他开源提供商一样,他认为大型实验室推广其工具的努力是锁定用户的一种方式; “他们需要拥有整个堆栈;否则,他们只是成为模型提供商,然后需要与中国模型竞争。”
他和其他接受采访的工程师TechCrunch认为,对前沿实验室的代币支出和代理行为的了解太有限。从某种意义上说,这对非技术工人来说意义不大,但与编码工具一样,OpenAI希望的大规模采用最终将迫使人们就成本进行更艰难的对话。
例如,在每月20美元的订阅上,我在四天内使用了超过8000万个代币,据模型的分析(应用程序中没有仪表板),花费了65美元。仅休闲使用四天,这就是订阅价格三倍以上的补贴。
“我们每天都在努力突破效率前沿,”Sottiaux说道,并指出最近为OpenAI的Luna型号用户降价80%。 “如果你六个月后醒来,你应该能够用更少的开支完成所有相同的[任务]。”
另一个相关问题是,这些应用程序是否通过数据保留对客户产生锁定效应,或者配置对所有插件及其权限的访问的纯粹痛苦。
我在7月份参观过OpenAI的总部,里面是木板镶板、种满植物的,气氛平静但略显紧张;这些人有很多事情要做。在我们交谈时,与我交谈的工程师一直在监控他们的笔记本电脑,并从一个会议室赶到另一个会议室。
产品工程团队负责人内森表示,重点仍然是“魔盒的承诺,但我仍然认为它太复杂了……我非常乐观地认为我们可以通过模型并以真正的人工智能原生方式解决这个问题。”