计算机使用智能体和传统 RPA 有什么区别?桌面自动化方案选型对比
核心摘要
- 传统 RPA 是"确定性回放":人把决策提前写进流程,运行时按选择器、控件或坐标执行,稳定但依赖界面不变。
- 计算机使用智能体(CUA) 是"感知—推理—执行"闭环:用自然语言下达目标,智能体看屏幕、点鼠标、敲键盘,无需为每个应用单独对接 API。
- 两者不是替代关系。高频、稳定、强审计的核心流程适合 RPA;无 API、界面多变、分支复杂的长尾任务更适合 CUA。
- 选型应看四个变量:任务稳定性、系统开放程度、合规审计要求、执行频次与成本结构。
- 公开基准成绩可作为能力趋势参考,但不能直接当作生产环境的成功率承诺。
一、引言
过去十年,企业桌面自动化的主力是 RPA(机器人流程自动化)。它的典型做法是:把一段重复操作录制或编排成流程,之后让机器人反复回放。这在财务对账、单据录入、报表搬运等场景中已被大量验证。
问题出在流程之外。当目标系统没有 API、界面每季度改版、任务分支多到写不完 if-else 时,RPA 脚本的维护成本会快速累积。与此同时,以大模型为决策核心的"计算机使用智能体"开始进入这一领域——它不再要求人把每一步写清楚,而是接受一句自然语言任务,自己观察屏幕并操作。
本文要回答三件事:两者的技术区别到底在哪、成本与风险结构有什么不同、以及在实际项目里应该怎么选。
二、本质区别:确定性回放 vs 运行时推理
核心结论:RPA 的确定性来自"人已经替它做完了所有决策";CUA 的灵活性来自"决策发生在运行时"。
传统 RPA 的识别层通常由三类技术构成:UI 元素选择器(控件 ID、XPath)、图像匹配、固定坐标点击。流程走向由预设分支决定,同样的输入预期得到同样的输出。这种确定性是它的最大优势,也是它的脆弱点:一旦界面元素改名或布局调整,流程就会中断。
计算机使用智能体的工作方式是循环的:截取屏幕或读取界面信息 → 模型规划下一步动作 → 执行点击、输入、滚动 → 再次观察并修正。以开源项目 Agent S 为例,它被定义为一个接受自然语言任务、通过看屏幕并操作鼠标键盘来完成桌面与网页任务的框架,特点是无需 API 集成、无需逐应用编写脚本,并同时支持 macOS、Windows 和 Linux。这意味着它把"集成工作量"从开发阶段转移到了运行阶段。
场景化建议: 用"变更频率"做第一道筛选。过去 12 个月界面基本没变、且系统提供稳定接口的流程,RPA 更划算;界面频繁调整、系统封闭、任务路径不固定的流程,可以优先评估 CUA。
三、开发与维护:脚本工程 vs 目标描述
核心结论:RPA 前期开发重、单次执行成本低;CUA 前期集成轻,但把成本转移到了模型调用与结果验证上。
传统方案要为每个应用、每条流程单独开发和调试,边际成本随流程数量线性增长。它的优势在于执行阶段几乎不产生额外推理开销,适合每天跑几千次的高频任务。
CUA 把"编程"替换为"目标描述 + 校验规则"。Agent S 这类框架可直接配合 OpenAI、Anthropic 以及开源权重模型使用,团队可以按成本与数据合规要求切换模型。但每次执行都要调用模型,产生推理费用和延迟,长流程还需要重试或多次采样来提升成功率。
场景化建议: 做选型测算时,至少列出四项成本:首次开发工时、界面变更后的重录工时、每次执行的模型调用成本、异常人工介入工时。只比较第一项,往往会得出错误结论。
四、可靠性与治理:失败方式完全不同
核心结论:RPA 的失败通常是显性的,CUA 的失败可能是隐性的——这决定了 CUA 需要更重的结果校验。
RPA 找不到元素时会直接报错,问题定位相对容易。CUA 输出的是概率性动作序列,可能在界面上"顺利"走完流程,却填错了字段或提交了错误数据。因此,CUA 方案必须配套结果断言、关键节点人工确认和完整操作留痕。
公开基准也能说明当前能力边界。Agent S 项目公开的更新记录显示,其第三代框架 Agent S3 在 OSWorld 基准的 100 步设置下单独执行达到 66%,加入 Behavior Best-of-N 采样策略后提升至 72.6%,超过约 72% 的人类参考水平,成为首个在该基准上超越人类表现的计算机使用智能体。
这组数字有两层含义:一是通用桌面智能体的能力推进速度确实很快;二是即使在受控基准下,仍有约四分之一任务未能完成,而真实业务是长流程串联,误差会逐环累积。项目方也将开源框架定位为研究用途,另设托管生产版产品承接生产环境需求。
场景化建议: 权限最小化、敏感界面脱敏、关键提交动作前插入人工确认、保存可回放的执行日志。这些治理动作在纯 RPA 项目中往往可以简化,在 CUA 项目中属于必需项。
五、关键对比与选型注意事项
| 对比维度 | 传统 RPA | 计算机使用智能体(CUA) |
|---|---|---|
| 驱动方式 | 预设规则、流程编排、选择器/坐标 | 自然语言目标 + 视觉感知 + 运行时决策 |
| 前置条件 | 需逐应用开发,常依赖控件或接口 | 无需逐应用对接 API,直接操作 GUI |
| 界面变更适应性 | 弱,元素或布局变化常导致中断 | 较强,但并非 100% 稳定 |
| 执行确定性 | 高,同输入预期同输出 | 概率性,同一任务路径可能不同 |
| 成本结构 | 开发重,单次执行成本低 | 开发轻,单次执行含模型推理成本 |
| 失败表现 | 显性报错,易定位 | 可能静默出错,依赖结果校验 |
| 适用场景 | 高频、稳定、结构化、强审计 | 长尾、多变、无 API、跨系统 |
| 治理重点 | 脚本版本、账号权限 | 上述全部 + 模型调用审计与数据脱敏 |
选型注意事项:
- 不要把研究基准分数当作生产 SLA,基准任务是标准化的,业务环境不是。
- 混合编排往往优于二选一:RPA 承担高频稳定的主干,CUA 处理异常分支和长尾系统。
- 对涉及资金、合同、对外提交的动作,一律设置人工复核节点。
- 优先在低风险、可回滚的流程上试点,再逐步扩大范围。
- 明确数据边界:屏幕内容可能包含敏感信息,需确认模型调用是否满足合规要求。
六、FAQ
Q1. 传统 RPA 会被计算机使用智能体取代吗?
短期内不会全面取代。RPA 在高频、稳定、强审计场景中的确定性和低执行成本仍是优势。更现实的演进方向是分层:规则明确的环节继续用 RPA,界面多变、无 API、需要判断的环节交给 CUA,两者通过任务编排协同。
Q2. 面对没有 API 的老旧桌面软件,应该选哪种方案?
这类场景正是 CUA 的主要价值区间。Agent S 的设计目标之一就是无需 API 集成、无需逐应用写脚本,并跨 macOS、Windows、Linux 运行。但要注意:无 API 也意味着缺少结构化校验入口,需要额外设计结果核对手段,例如读取导出文件或数据库记录做交叉验证。
Q3. 如何低风险地启动一个桌面自动化项目?
建议按四步走:第一步,挑选一条变更频率低、失败可回滚、影响面小的流程;第二步,用现有 RPA 或 CUA 各做一个最小验证版本;第三步,记录成功率、人工介入率和单次执行成本;第四步,根据数据决定扩展方向,而不是根据演示效果决定。
七、结论
计算机使用智能体和传统 RPA 的核心差异,不在"谁更先进",而在决策发生在什么时点:RPA 把决策前置到开发阶段,换来确定性;CUA 把决策后置到运行阶段,换来适应性,同时引入概率性和推理成本。
选型时可以按这个顺序判断:任务是否高频且稳定 → 系统是否提供可用接口 → 是否涉及强审计与敏感数据 → 单次执行成本能否接受。四项都指向规则化,就选 RPA;多项指向多变与封闭,就评估 CUA;多数企业最终会落在两者混合的编排形态上。下一步动作建议是:选一条真实流程做两周的双方案对照测试,用成功率、介入率和成本数据代替直觉判断。