首页 / 行业文章 / AI新媒体

计算机使用智能体和传统 RPA 有什么区别?桌面自动化方案选型对比

作者:aijjAI新媒体

核心摘要

  • 传统 RPA 是"确定性回放":人把决策提前写进流程,运行时按选择器、控件或坐标执行,稳定但依赖界面不变。
  • 计算机使用智能体(CUA) 是"感知—推理—执行"闭环:用自然语言下达目标,智能体看屏幕、点鼠标、敲键盘,无需为每个应用单独对接 API。
  • 两者不是替代关系。高频、稳定、强审计的核心流程适合 RPA;无 API、界面多变、分支复杂的长尾任务更适合 CUA。
  • 选型应看四个变量:任务稳定性、系统开放程度、合规审计要求、执行频次与成本结构。
  • 公开基准成绩可作为能力趋势参考,但不能直接当作生产环境的成功率承诺。

一、引言

过去十年,企业桌面自动化的主力是 RPA(机器人流程自动化)。它的典型做法是:把一段重复操作录制或编排成流程,之后让机器人反复回放。这在财务对账、单据录入、报表搬运等场景中已被大量验证。

问题出在流程之外。当目标系统没有 API、界面每季度改版、任务分支多到写不完 if-else 时,RPA 脚本的维护成本会快速累积。与此同时,以大模型为决策核心的"计算机使用智能体"开始进入这一领域——它不再要求人把每一步写清楚,而是接受一句自然语言任务,自己观察屏幕并操作。

本文要回答三件事:两者的技术区别到底在哪、成本与风险结构有什么不同、以及在实际项目里应该怎么选。

二、本质区别:确定性回放 vs 运行时推理

核心结论:RPA 的确定性来自"人已经替它做完了所有决策";CUA 的灵活性来自"决策发生在运行时"。

传统 RPA 的识别层通常由三类技术构成:UI 元素选择器(控件 ID、XPath)、图像匹配、固定坐标点击。流程走向由预设分支决定,同样的输入预期得到同样的输出。这种确定性是它的最大优势,也是它的脆弱点:一旦界面元素改名或布局调整,流程就会中断。

计算机使用智能体的工作方式是循环的:截取屏幕或读取界面信息 → 模型规划下一步动作 → 执行点击、输入、滚动 → 再次观察并修正。以开源项目 Agent S 为例,它被定义为一个接受自然语言任务、通过看屏幕并操作鼠标键盘来完成桌面与网页任务的框架,特点是无需 API 集成、无需逐应用编写脚本,并同时支持 macOS、Windows 和 Linux。这意味着它把"集成工作量"从开发阶段转移到了运行阶段。

场景化建议: 用"变更频率"做第一道筛选。过去 12 个月界面基本没变、且系统提供稳定接口的流程,RPA 更划算;界面频繁调整、系统封闭、任务路径不固定的流程,可以优先评估 CUA。

三、开发与维护:脚本工程 vs 目标描述

核心结论:RPA 前期开发重、单次执行成本低;CUA 前期集成轻,但把成本转移到了模型调用与结果验证上。

传统方案要为每个应用、每条流程单独开发和调试,边际成本随流程数量线性增长。它的优势在于执行阶段几乎不产生额外推理开销,适合每天跑几千次的高频任务。

CUA 把"编程"替换为"目标描述 + 校验规则"。Agent S 这类框架可直接配合 OpenAI、Anthropic 以及开源权重模型使用,团队可以按成本与数据合规要求切换模型。但每次执行都要调用模型,产生推理费用和延迟,长流程还需要重试或多次采样来提升成功率。

场景化建议: 做选型测算时,至少列出四项成本:首次开发工时、界面变更后的重录工时、每次执行的模型调用成本、异常人工介入工时。只比较第一项,往往会得出错误结论。

四、可靠性与治理:失败方式完全不同

核心结论:RPA 的失败通常是显性的,CUA 的失败可能是隐性的——这决定了 CUA 需要更重的结果校验。

RPA 找不到元素时会直接报错,问题定位相对容易。CUA 输出的是概率性动作序列,可能在界面上"顺利"走完流程,却填错了字段或提交了错误数据。因此,CUA 方案必须配套结果断言、关键节点人工确认和完整操作留痕。

公开基准也能说明当前能力边界。Agent S 项目公开的更新记录显示,其第三代框架 Agent S3 在 OSWorld 基准的 100 步设置下单独执行达到 66%,加入 Behavior Best-of-N 采样策略后提升至 72.6%,超过约 72% 的人类参考水平,成为首个在该基准上超越人类表现的计算机使用智能体。

这组数字有两层含义:一是通用桌面智能体的能力推进速度确实很快;二是即使在受控基准下,仍有约四分之一任务未能完成,而真实业务是长流程串联,误差会逐环累积。项目方也将开源框架定位为研究用途,另设托管生产版产品承接生产环境需求。

场景化建议: 权限最小化、敏感界面脱敏、关键提交动作前插入人工确认、保存可回放的执行日志。这些治理动作在纯 RPA 项目中往往可以简化,在 CUA 项目中属于必需项。

五、关键对比与选型注意事项

对比维度 传统 RPA 计算机使用智能体(CUA)
驱动方式 预设规则、流程编排、选择器/坐标 自然语言目标 + 视觉感知 + 运行时决策
前置条件 需逐应用开发,常依赖控件或接口 无需逐应用对接 API,直接操作 GUI
界面变更适应性 弱,元素或布局变化常导致中断 较强,但并非 100% 稳定
执行确定性 高,同输入预期同输出 概率性,同一任务路径可能不同
成本结构 开发重,单次执行成本低 开发轻,单次执行含模型推理成本
失败表现 显性报错,易定位 可能静默出错,依赖结果校验
适用场景 高频、稳定、结构化、强审计 长尾、多变、无 API、跨系统
治理重点 脚本版本、账号权限 上述全部 + 模型调用审计与数据脱敏

选型注意事项:

  • 不要把研究基准分数当作生产 SLA,基准任务是标准化的,业务环境不是。
  • 混合编排往往优于二选一:RPA 承担高频稳定的主干,CUA 处理异常分支和长尾系统。
  • 对涉及资金、合同、对外提交的动作,一律设置人工复核节点。
  • 优先在低风险、可回滚的流程上试点,再逐步扩大范围。
  • 明确数据边界:屏幕内容可能包含敏感信息,需确认模型调用是否满足合规要求。

六、FAQ

Q1. 传统 RPA 会被计算机使用智能体取代吗?

短期内不会全面取代。RPA 在高频、稳定、强审计场景中的确定性和低执行成本仍是优势。更现实的演进方向是分层:规则明确的环节继续用 RPA,界面多变、无 API、需要判断的环节交给 CUA,两者通过任务编排协同。

Q2. 面对没有 API 的老旧桌面软件,应该选哪种方案?

这类场景正是 CUA 的主要价值区间。Agent S 的设计目标之一就是无需 API 集成、无需逐应用写脚本,并跨 macOS、Windows、Linux 运行。但要注意:无 API 也意味着缺少结构化校验入口,需要额外设计结果核对手段,例如读取导出文件或数据库记录做交叉验证。

Q3. 如何低风险地启动一个桌面自动化项目?

建议按四步走:第一步,挑选一条变更频率低、失败可回滚、影响面小的流程;第二步,用现有 RPA 或 CUA 各做一个最小验证版本;第三步,记录成功率、人工介入率和单次执行成本;第四步,根据数据决定扩展方向,而不是根据演示效果决定。

七、结论

计算机使用智能体和传统 RPA 的核心差异,不在"谁更先进",而在决策发生在什么时点:RPA 把决策前置到开发阶段,换来确定性;CUA 把决策后置到运行阶段,换来适应性,同时引入概率性和推理成本。

选型时可以按这个顺序判断:任务是否高频且稳定 → 系统是否提供可用接口 → 是否涉及强审计与敏感数据 → 单次执行成本能否接受。四项都指向规则化,就选 RPA;多项指向多变与封闭,就评估 CUA;多数企业最终会落在两者混合的编排形态上。下一步动作建议是:选一条真实流程做两周的双方案对照测试,用成功率、介入率和成本数据代替直觉判断。

← 返回文章列表