作者:a16z
编译:深潮 TechFlow
深潮导读:当计算机使用 AI 从演示走向规模化生产,投资者需要关注的不再是哪个模型跑分最高,而是哪些公司能把验证、容错、流程知识等软性能力变成可复用的产品。这篇文章拆解了一线团队的真实部署数据,揭示了 AI 代理落地企业后台的真正瓶颈和护城河所在。

代理能用电脑了吗?我们用数据回答
当你最重的用户不再查看排行榜,排行榜就不再是故事
这道理似乎很简单,但如果你离开硅谷,去世界其他地方告诉人们:「有一种叫代理的东西,相当聪明,能和你一起完成工作,还能自动化你工作中那些重复的部分」,对方很有可能会问:「它们能用电脑吗?」
这是个好问题!它们到底能不能?在未来几十年里,我们要去释放的生产力潜力,贯穿在极其日常的工作中:一个代理能不能(比喻意义上的)24 小时坐在办公桌前,被信任地用浏览器、填表格、点对按钮、不出错?这就是业务流程外包的领域,过去这意味着「这个工作能不能外包出去?」,但现在有了全新代理驱动的新前沿。我们去年写过这个话题,当时计算机使用的前景还基本只是一堆演示。从那时起,变化很大。
模型进步的速度几乎超出所有人的预期。能够使用电脑的代理开始在规模化生产中站稳脚跟,面向那些狭窄、可重复的工作流:更新记录系统、在门户间搬运数据、处理工单、核对记录、搞定那些没有清晰 API 的长尾软件。有了合适的基础设施,计算机使用能力现在可以部署来处理端到端的任务,而此前这些工作需要人工监督或直接由人完成。
如今,利用计算机使用能力的工作流远非完美:当工作偏离标准操作手册时,代理会很脆弱;在某些无法缓存的用例中(详见下文),成本高到让这笔账算不过来。但我们已看到标准化后台工作的生产部署,特别是那些否则就得人工点击遗留系统的工作;成本曲线开始变得有吸引力,考虑到利用计算机使用的工作流提供结构性优势,比如全天候可用,以及最重要的——可扩展以应对需求。
第一波计算机使用基础设施的目的是让代理具备能力:看、点击、打字、从错误中恢复。下一波则是让它们在真实的公司里变得有用。当原始页面导航成为模型层的大宗商品,模型就不再是主要瓶颈,持久的优势会向上转移:上下文、权限、流程知识、验证、升级、错误处理、缓存,以及在某个具体客户组织内工作到底如何完成的、来之不易的理解,从而端到端地映射一个工作流。换句话说,前沿正从「代理能用电脑吗?」转向「它能靠谱地干这份工作吗?」
从人类盯着每一步到真正自主的工作流
一年前,最好的计算机使用模型在 OSWorld-Verified 上得分 42%;今天最好的模型得分 85%,超过了人类在同一任务上约 72% 的成绩(这意味着它们成功完成了 100 个任务中的 85 个)。在生产中,这些通用前沿模型的表现很像基准测试中的样子:各大实验室把计算机使用作为 API 暴露——模型获得一张截图,返回点击和按键,OpenAI 的 CUA 在可用时还会叠加无障碍树或 DOM 数据——构建者则把这一循环包裹在自己的控制体系里:一个沙盒虚拟机或浏览器,外加编排、验证和重试逻辑。值得注意的是,几乎没人为此部署消费级产品(比如 Claude、ChatGPT 的代理模式)——创始人和企业直接构建在原始 API 上,或者向打包这些 API 的供应商购买。能力的飞跃正是让这些设置变得可行的原因,「直到 2026 年 2 月Opus 4.6 出来,模型才真正靠自己在生产环境中够用了,」一位正在此领域创业的创始人如此说道。在过去十八个月里的某个时间点,计算机使用能力跨过了从演示到可以实地部署的门槛。

图:OSWorld-Verified 计算机使用基准测试成绩逐年提升,2026 年最佳模型已超越人类水平
来源:a16z
当然,基准测试并不总是现实世界部署可行性的最佳代表。OSWorld 计数已完成的任务,所以 85% 依然意味着 100 个任务里失败了 15 个,而业务流程只有在每一步都成功时才算完成。后台工作不看曲线:如果每个输出都需要人审核,那人工就根本没省下来。(这类似于当前写代码领域发生的事:稀缺资源不再是写出代码,而是为代码担保。)
我们发现,思考什么才是重要的最好办法是超越基准测试,聚焦核心问题:一个业务流程能不能可靠地用计算机使用能力自动化?在这个视角下,影响最大的就是模型周围的一切——即验证、升级、错误处理,当某个零售门户网站一夜之间改版时该怎么办。
或许最清楚的信号是:我们交谈的一位运营商每月运行数百万个自动化任务,他没法告诉我们执行任务的是哪个模型;他不需要知道。他的供应商在模型底下切换,就跟云厂商切换硬件一样。但他确实信任那个用电脑的代理来跑这些任务。核心要点:当你最重的用户不再查看排行榜,排行榜就不再是故事。
因此,上图解释了为什么生产部署出现在 2026 年而不是 2024 年。从那里开始,决定它们是否有效的就是其他一切了——这也是本文剩下的部分。
代理是在遵循协议
我们与许多在生产中运行、利用计算机使用工作流的团队聊过,从他们的经验中学到,遵循协议的任务表现最好。毫不意外,在准确性更难验证的复杂工作流上,用电脑的代理就会出故障。总体结论是,计算机使用代理在有清晰、定义明确路径的标准化、可重复任务上最强。真正的变革在于那些没有干净 API、否则就得人工点击界面的长尾软件。实践中,这些工作看起来像在 CRM 中更新记录、质量保证、登录政府和保险门户、从数据库和监管页面拉取数据、零售订单处理、合同处理,或者 ServiceNow 里的 IT 工单。
我们相信,用户的声音比任何理论都更能说明问题。举几个例子:一家快消品数据平台向我们演示了他们如何每月运行约 1500 万到 2000 万次自动化门户交互,将代理用作手工编码爬虫的自愈回退——当零售门户改版,代理会诊断故障、修复自动化,并在工程师还没看到报错之前就维持数据流动。他们告诉我们,实施后,专门维护爬虫的工程团队被砍了一半,人力被重新分配到其他工作流上。另一个案例来自一家全球系统集成商,我们得知他们有 27 个实时工作流,利用计算机使用代理每天处理约 1500 到 2100 张 IT 工单,最终目标是在低利润的托管服务合同上重新部署 20% 到 25% 的人力。最后,一家机构告诉我们他们如何端到端自动化了一个招聘工作流,在候选人面试一结束就把数据填入应聘跟踪平台。为此,他们跑的是一个便宜的非前沿模型,因为它「做我们需要的所有事,而且做得好」。
最清晰的模式是那些理论上计算机使用代理能操作并解决的任务,但对于「怎么做才算好」却没有明确答案(即难以评估),或者没有可靠方式判断任务是否成功。问题通常会很快出现,当:(1)你无法交叉核对输出——想象代理从合同中提取付款条件到 ERP:如果它把「净 60」读成「净 30」,记录看起来完全合理,通过所有视觉检查,直到发票开错才会被发现;(2)在某些情况下,任务运行时根本没有信号来验证成功——想象代理在保险门户上提交理赔:提交通过,屏幕显示「已收到」,任务完成。只不过两天后理赔员打电话到办公室,因为保单号需要确认才能继续处理。提交该理赔的人类员工会接起电话,半分钟就搞定;代理完全不知道这通电话发生过,理赔就悄悄卡住了。总结起来就是,如果流程的真实依据是一周后打到某人桌上的那通电话,更聪明的模型也无济于事,除非控制体系从最开始就被设计来应对这种边缘情况。
买家关心的是基础设施
对于与我们交谈的买家而言,模型本身很少是决定因素,因为「今天的模型已经够好了」。实践中,他们评估并付费的,是模型周围的一切:能在规模下可靠运行、通过安全审查并证明投资回报率的基础设施。用户不在乎解决方案是否用了某个前沿模型;他们只关心它能不能在规模下切实可靠地完成任务。仅此而已。
因此,失效模式比任何基准都重要,围绕失败的设计必须从第一天起就是头等大事,因为一个处理不好失败的解决方案永远不会被生产环境采用。一个我们不止一次遇到的典型模式:代理先跑一次工作流,系统把它缓存为确定性代码,此后都以廉价的可重复代码执行,模型只在出错时回来——诊断、修复、重新缓存。用这种方法,每个工作流在其生命周期内每次运行的成本都会下降,而且用更便宜的模型只会降低账单。这里有意思的地方是它如何处理不确定性。过去确定性代码只能直接失败,或者需要人去审查和修复每一次故障,而这里代理自己吸收了这些不确定性。这是一种为失败设计的思路,也显示了买家们在实际规模下真正奖励和使用的是什么。
在我们接触的用户中,我们没有遇到更复杂的用例,这告诉我们市场仍在收割那些容易摘到的果子。话虽如此,在任何人需要攻坚更困难的任务之前,还有一大批工作流可以用这种方式自动化。
模型不是差异化的来源,上下文才是
对创始人来说,更重要的转变是哪些东西正在变为大宗商品。过去构建一个计算机使用代理意味着用 Selenium 或 Playwright(最近是 Stagehand)苦苦折腾,把 DOM 或视频记录缝合在一起来捕捉一条工作流。整个执行层正在被抽象掉,就跟 Claude Code 抽掉了编码代理周围的脚手架一样。如果点对按钮不再是难点,那它就不再是护城河。
毫不意外,工作流的上下文和知识才是持久的。难点不在于代理能不能导航一个 SAP 界面,而在于它是否理解某家特定公司到底是如何完成工作的:那些内部经验知识、内部的术语、偏好的格式、何时向谁升级、如何处理失败、如何可靠地验证输出。在实践中,这些上下文存在于标准操作手册里,存在于访问凭证和授权里,存在于测试用例和工作跑偏时的护栏里,而且越来越存在于一个人做一遍工作所录制的单一视频里。这里面没有一样是通用的,全都针对某家公司,甚至常常只针对某一个团队。话虽如此,这恰恰是那种具体的、不起眼的问题,专注的创业公司倾向于比模型提供商解决得更好,这也是为什么我们认为下一代代理同事的构建发生应用层和上下文层,而不是模型层。
我们交谈的买家们明确证实了这一点。他们挑选供应商的依据是产品能否在不多添额外工作的情况下报告节省了多少工时,以及一个初级工程师能不能把它用起来。就目前而言,护城河不是前沿能力——而是成为一家企业被允许、并且有能力在规模化生产中使用的供应商。
真正的转折点是经济性的,而不仅仅是技术性的
成本数据同样令人鼓舞。请将上述数字视为数量级,而非精确报价。如今,一个智能体每运行一小时推理大约花费 6 到 8 美元,但实际上根据套件构建方式的差异,开销会在 3 到 15 美元之间浮动——取决于截屏频率、携带的上下文量,以及有多少工作能移交给确定性代码。以上数据描述的是智能体通过截屏操作界面、调用前沿模型的情况,这是成本最高的模式。精心设计的套件会将这种模式留到真正需要的时候,让便宜的确定性代码处理可重复部分——并非每个工作流都能这样优化,但只要可以,混合成本就会迅速下降。所以,这个对比可以看作最坏情况,即便如此,智能体与约 10 美元/小时全包价的离岸 BPO 相比大致盈亏平衡,而对比约 30 至 45 美元/小时的美国后台人力,则能算出 70% 至 80% 的毛利率。在实际生产中,套件与实际模型同样左右着真实成本。

图:计算机使用智能体、离岸 BPO、美国后台人力每小时全包成本对比
来源:a16z
速度方面也有相同前提。在智能体模式下,智能体仍比人慢,而且差距不小——有人两三分钟能完成的任务,智能体需要八到十分钟,学术基准的差距甚至更大。确定性运行则截然相反:代码执行速度远超任何人——但就智能体工作而言,关键不在速度。而在于智能体可以全天候运行,成本仅为美国劳动力零头,并且无需招聘即可扩展。
这类比对对 BPO 买方和运营团队来说成立,但如果你是出售智能体工时的那一方,单元经济模型会不同,因为实际场景中的成本更不可预测。销货成本等于推理加上重试次数(即运行失败仍会消耗 token),当上下文增加或截屏频率上升时,利润空间随之压缩。服务商的管理方式是按任务、按小时或按结果定价,每种方式对应不同的风险敞口,具体取决于工作流的波动性。还有监控、维护和人工升级等现实问题,这些都在定价中被计入,就像计算人类劳动力时一样。这里尚不存在通用商业模式,不同垂直领域的答案各异。
而且账只会越算越划算——推理成本持续下降,开源模型在越来越多工作流中已足够好用。对于任何智能体能可靠解决的任务,嵌入计算机使用能力很可能会比人力方便得多。所以真正的问题不再是经济学上是否可行,而是那套可以可靠解决的任务集合到底能扩展多远,这正是接下来的发展方向。
我们下一步往哪走?
过去一年中,各大实验室和一批初创公司已在计算机使用的强化学习环境上投入数亿美元——这些沙盒供模型练习真实任务,完成即获奖励——像 Mechanize、Habitat、Fleet、Chakra、Deeptune、Matrices 和 Originator 等公司,正在为前沿模型之下构建训练和评估的基座。这些投入表现为更强的推理能力、更优的状态跟踪,以及对应用出错的更高容忍度。模型仍需精细套件才能在生成中撑得住,运行缓存即是最明显的一例,但原始能力正是通过这些训练基础设施有意识地购入,而且只会随时间越来越好。
不过架构却另当别论。今天多数部署到生产环境的计算机使用系统是单智能体:单模型、单任务、单会话。当工作流变得更加复杂、延迟成为约束时,多智能体架构就开始重要起来。举例来说,规划器拆解工作流,执行器并行处理子任务,而长时间运行的智能体则带来自身麻烦:记忆、信任以及随时间不断恶化的失败率。在这方面做出有趣成果的团队全都在自建定制化编排,因为目前还没有标准框架。Claude Code 的类比很有启发性:编程智能体成熟时,冒出了一个脚手架层来抽象化编排。对利用计算机使用能力的工作流来说,同样的事情很可能发生,而这一抽象层正是该领域最有趣的未解决基础设施问题之一。
从这里出发,未来发展沿着三条主线展开:准确性、延迟和成本。准确性最为重要,正如上文解释过的,它是酷炫演示和真正解决问题之间的分水岭——捕获异常、核对自己的工作,只在实际需要时才升级。延迟最有可能让人意外:有些团队今天已经通过基于无障碍树而非截屏来缩短延迟。Standard Intelligence 的通用计算机行动模型在一个 1100 万小时的视频数据集上训练,以 30 FPS 运行,这是一个早期信号,表明拖慢当今智能体的逐步截屏循环是一个可解决问题,而非长期税负。成本随着推理变便宜而持续下降,更小的非前沿模型接手了常规点击操作。此外还有安全与治理向量(如凭证、审计日志、数据保留、提示注入以及问责和权限管理)。
企业能够且正在从计算机使用智能体中获益,用于那些大规模、重复步骤、业务规则稳定、只存在老旧界面或缺少 API 的狭窄工作流。目前,它们最适合那些具备即时、机器可观测的成功证据、失败后果可容忍且具有清晰升级路径的任务。但伴随上述发展,进步真实而快速,正在使计算机使用智能体适用于更多工作类型。
这么说吧——计算机使用能力的前景一片光明!
免责声明:本文章仅代表作者个人观点,不代表本平台的立场和观点。本文章仅供信息分享,不构成对任何人的任何投资建议。用户与作者之间的任何争议,与本平台无关。如网页中刊载的文章或图片涉及侵权,请提供相关的权利证明和身份证明发送邮件到support@aicoin.com,本平台相关工作人员将会进行核查。