一份不算长的政策文件,今天在北京落地,却把一串几个月前还只活跃在论文和技术社区黑话里的词,一口气写进了正式公文。这份《北京市关于加快智能体引领发展的若干措施》一共十条,Agentic AI、Harness Engineering、AI OS、FDE、OPC、Token 经济、TaaS、AaaS、RaaS、Token 工厂、AIP 悉数在列。尤其当"驾驭层工程"堂堂正正坐在第二条,智能体经济的宏伟蓝图,第一次有了政策级的清晰轮廓。

第一条指向基础模型,关键措辞是"持续提升大模型实际任务完成能力"。过去几年大模型比的是 Benchmark 分数,而 Agent 真正上工时,往往只拿到一个模糊目标,得自己补齐信息、拆计划、调工具、读反馈、改路线,跑到结果出现为止。这里有一笔残酷的账:假设 Agent 连续执行100步、每步正确率99%,全部做对的概率只剩约36.6%;即便单步拉到99.9%,完整跑通也仅约90.5%。Agent 的实用价值因此更像一道乘法——模型能力乘以长程可靠性,乘以环境可操作性,再乘以结果可验证性,任何一项趋近于零,总价值就趋近于零。前沿评测也已转向这个方向,比如 METR 提出的 Task Completion Time Horizon,直接测 Agent 能以50% 或80% 成功率独立完成一项本需人类专家干多久的任务,这也解释了为何代码会成为 Agent 最早爆发的领域:它高度数字化、可回滚、可验证。
第二条把 Harness Engineering 译为"驾驭层工程",要求围绕上下文工程优化、任务持久化、多智能体协作、系统可扩展夯实共性底座。模型只提供潜在能力,能力能否稳定兑现,取决于模型周围那整套系统——上下文怎么选、工具怎么调、任务怎么拆、权限怎么控、状态怎么存、失败怎么重试、结果由谁验,这些合起来就是 Harness。今年4月论文《Agentic Harness Engineering》验证过:保持基础模型不变,只迭代模型外的工具、中间件、长期记忆和可观测系统,十轮后 Terminal-Bench2的 Pass@1从69.7% 提到77.0%,换到其他模型家族仍有5.1到10.1个百分点的提升,且增益更多来自工具、中间件和长期记忆,而非单纯改系统 Prompt。政策还点到了技能市场、软件商店和 AIP 等互联标准——未来很多软件的直接用户会变成 Agent,比拼的不只是 App Store 排名,还有怎样被 Agent 发现、成为它默认调用的 Skill。
第三条鼓励基于智能体重构底层架构,核心是"需求智能"。软件智能分三层:功能智能只给某个节点加个生成按钮;流程智能能串起固定工作流里的几步;需求智能则是用户只说想要的结果,系统自己判步骤、调模型与 Skill、连软件、找审批,对完整结果负责。与之呼应的是"超级软件"——它的强不在于功能更多,而在于跨过原有软件边界、统一理解需求再重组分散能力。这条专门写了 FDE(前沿部署工程师):进入客户现场,和业务一起拆流程、接系统、清数据,再把每天的新问题带回产品。判断标杆场景有五个条件——任务频率、人工成本、数字化程度、结果可验证性、错误可撤销性,占得越多越易产生真实 ROI,这也解释了政策为何挑中科学、医疗、教育、政务、制造和文化。
第四条从软件走到终端,要求把智能体深度嵌入手机、眼镜、耳机、可穿戴、机器人和汽车,推动"芯模云端用五位一体"。终端 Agent 需要持续感知环境、理解用户状态、记住长期上下文,在合适时机决策并通过设备执行;传感器让它感知世界,设备身份和个人数据让它理解"我是谁",操作系统与执行器让它改变世界。端侧负责低延迟感知、身份验证、隐私数据和高频简单任务,云端负责复杂规划与推理,设备间还要共享任务状态,让一个任务从耳机开始、在手机继续、到汽车或电脑完成。文件还把符合条件的新产品纳入家电以旧换新和数码智能产品购新范围,直接补上需求侧。
第五条是对普通人最直接的一条:支持以 OPC(一人公司)为代表的创新创业新模式。它背后是企业边界的松动——1937年科斯解释过公司为何存在,因为内部协调比每次去市场临时找人、谈判、签约、监督更便宜;而 Agent 同时在压低执行成本和协调成本,写代码、做设计、理客户、回咨询、处报表这些过去需多岗位协作的知识工作,能被一个人用多套 Agent 串起来,企业的最小可行规模随之下降。政策没只喊一句口号,而是续写了弹性算力、专业孵化、创业辅导、科技金融、知识产权、政策咨询、OPC 社区、全周期服务站、供需对接和便利化登记,相当于把过去公司内部的后台能力搬到社会公共服务层。对想抓住机会的个人,真正需要三种资产:行业判断、客户与信任、可复用的 Agent 系统。
第六条关于 Token 经济。Agent 执行的是动态任务,长度、上下文、推理轮数、工具数、重试数都不确定,花掉20亿 Token 却一无所获是常态,这让 Token 能当成本计量单位,却难当价值货币。政策一边提 Token 服务质量评估和计费规范,一边鼓励建立由智能质量、调用量、转化效率组成的评价体系,并写下整条里最重的一句话——"鼓励创新主体从 Token 消耗量计费转向价值计费"。三类商业模式对应三个价值层级:TaaS 卖基础 Token 与推理供给,比价格、速度、稳定与模型质量;AaaS 把模型、工具和 Harness 封装成能干的 Agent,卖一项能力;RaaS 直接卖结果,客户只关心合同审完没、代码修好没、线索转化没。越往上离 Token 越远、离客户价值越近,但 RaaS 难度也陡增,供应商要扛任务失败、重复执行、成本波动、质量验收和赔偿责任。Agent 公司此后该算的新账叫 Cost per Successful Task(每个成功任务的成本),再往上是 Value per Successful Task(每个成功任务创造的价值);文件还提出把符合条件的 Token 新产品纳入中小企业服务券,探索 Token 券和智能体服务券,用 Token 工厂解决供给、服务券启动需求、价值计费维持闭环。
第七条谈安全。聊天机器人只产内容,Agent 却拿到行动权,能改代码、调支付、控设备、代用户联络他人,风险从"一句话说错"扩大到"一件事做错"。Agent 安全至少要同时应对五个问题:目标理解错、权限越界、提示词注入操控、长期记忆被污染、多 Agent 间错误被快速放大,而连接第三方工具和 Skill 又让任何插件或接口的故障都能沿任务链侵入核心。文件的安全措施已从内容审核走向运行时治理;今年5月国家网信办等三部门发布的《智能体规范应用与创新发展实施意见》已提出划分仅限本人决策、需授权决策、自主决策的边界。分级分类监管反而可能帮行业加速——低风险任务自测快上,高风险任务严检加人工确认,安全在这里既是约束,也是市场准入证。
第八条实施"银河算廊"工程,建设面向智能体高频并发、低延迟需求的新型算力基础设施,推动算力网络与5G-A、6G、F5G 融合,并挖掘存量算力、把小散算力"零存整取"。训练大模型是集中式大工程,Agent 推理却像一张长期运行的生产网络,全天候响应海量任务、负载随真实业务剧烈波动,未来要调度的不只是 GPU,还有云边端不同芯片、不同模型、不同地区数据权限与网络条件。银河算廊的价值近似为智能生产建设一套算力物流系统,算力路由、异构调度、边缘推理由此长出机会;文件还支持银行保险机构开发服务智能体落地的金融产品,因为 Agent 公司早期最值钱的资产是代码、数据和合同,而新时代最核心的新资产叫"任务轨迹"——目标、计划、动作、观察、纠错、结果这一整条链,既可用于训练模型、优化 Harness,也能发现安全漏洞、分析业务流程。
第九条推动开源开放,提出高水平建设中国与上合组织国家人工智能应用合作中心,研究一国一策的大模型和智能体出海路径,并建设有全球影响力的开源社区。智能体时代格外需要开源与协议,因为它天生要连接,且生态网络效应极强——一个新 Skill 接入后,所有兼容协议的 Agent 都可能获得这项能力,Agent 越多开发者越愿供 Skill,Skill 越多 Agent 越有用,谁的协议被广泛采用,谁就掌握开发入口与生态话语权。文件专门提评价开源贡献度,因为开源真正昂贵的是长期维护与社区运营;出海部分则因智能体比普通内容产品更深嵌入当地经济,需面对更复杂的隐私、责任与准入问题,故提"一国一策"。
第十条写保障,统筹国家和市区财政资金、政府投资基金、市场化基金,对符合条件的技术攻关、共性平台和示范应用给予支持。这份政策覆盖之广,已从单一技术产业外溢到科技研发、软件、制造、消费、创业、金融、监管、人才和国际合作。智能体时代对每个人和每家公司都是一次直接的能力重估:大多数职业不会一夜消失,更现实的是被拆成几十个任务,其中重复、流程化、易验证的部分率先被 Agent 接走;只会完成中间步骤、无法判断结果、无法对最终交付负责的人,压力只会越来越大。机遇恰恰藏在任务重新分配与能力重新定价里——过去一个人做成公司需要资金、团队和复杂管理,现在带着一套成熟 Agent 系统,也有机会从一个很小的真实任务开始放大自己,但 Agent 不会自动带来成功,它只会把一个人的目标、判断、专业和执行系统一起放大。