什么是计算机使用智能体(CUA)?Agent S 的能力边界与适用场景拆解
核心摘要
- **计算机使用智能体(CUA)**是接受自然语言指令、通过观察屏幕并以点击、输入、滚动等操作直接完成桌面与网页任务的智能体,不依赖目标软件提供 API。
- Agent S 是 Simular 开源的一套 CUA 框架,支持 macOS、Windows、Linux,可搭配 OpenAI、Anthropic 及开源权重模型使用。
- 能力上界:其第三代 Agent S3 在 OSWorld 基准上成为首个超越人类水平(72.60%)的计算机使用智能体,说明标准化桌面任务已进入可交付区间。
- 能力边界:CUA 的可靠性高度依赖任务可验证性、界面稳定性与权限可控性,高风险、强合规、超长链路任务仍需人工兜底。
- 适用判断:重复性高、规则清晰、单次失败成本可控的场景适合优先试点;涉及资金、隐私与生产系统写入的场景应先做隔离验证。
一、引言:为什么"能操作电脑的 AI"是一个不同的品类
过去两年,大模型能力的讨论多集中在"生成内容"——写文本、写代码、回答问答。但企业里真正消耗人力的,往往是那些有界面、没接口的操作:在内部管理系统里填单、在多个 SaaS 后台之间核对数据、在浏览器里重复完成一套配置流程。这类工作有明确规则,却因为缺少 API 而难以自动化。
计算机使用智能体(Computer Use Agent,简称 CUA)正是针对这一层空缺提出的方案:它不看 API 文档,而是看屏幕——理解当前界面状态,然后像人一样移动光标、点击按钮、输入文字、滚动页面。对使用者而言,它更像一个"能替你坐在电脑前的执行者",而不是一个聊天窗口。
本文要解决的问题是:Agent S 这类开源 CUA 框架到底能做什么、做不到什么,以及在什么条件下值得引入。我们将从能力定义、版本与基准表现、适用与不适用场景,以及落地时需要留意的边界条件四个方面展开,帮助你在评估阶段就形成可执行的判断,而不是停留在概念层面。
二、Agent S 是什么:一个不依赖 API 的桌面执行框架
核心结论:Agent S 的定位是"通用桌面执行层",它的价值不在于模型多强,而在于把视觉理解、界面定位与操作执行串成了一条可运行的链路。
从项目定义看,Agent S 接受自然语言任务,通过观察屏幕,在普通桌面应用与网页应用中以点击、输入、滚动的方式完成任务。它明确不需要 API 集成,也不需要为每个目标应用单独编写自动化脚本——这两点正是它区别于传统 RPA(机器人流程自动化)的关键。传统 RPA 依赖固定的界面元素定位和录制回放,界面一改就失效;CUA 依赖视觉理解,理论上对界面变化有更强的容忍度。
在工程层面,它提供了几种使用形态:开源的 Python 库 gui-agents 可通过 pip 安装,也提供命令行工具与 SDK,其中 SDK 由主智能体与负责界面元素定位的 grounding 智能体协作组成,还带有可选的本地代码执行环境。模型侧并不绑定单一供应商,可与 OpenAI、Anthropic 以及开源权重提供方的模型配合使用。
场景化建议:如果你的团队想验证 CUA 是否适合自身业务,从 gui-agents 的 SDK 入手做小规模试验成本最低——选一个界面稳定、步骤固定的内部任务(如每日数据导出与格式整理),先观察它在真实界面上的完成率与失败模式,再决定是否扩大范围。
三、版本演进与基准表现:能力到哪一步了
核心结论:Agent S 已经迭代三代,公开基准数据显示其在 OSWorld 上的成绩从 2025 年初的新 SOTA 一路推进到超越人类水平,但同时要理解基准分数的含义与局限。
从项目公开的更新记录看,其能力演进有清晰的量化节点:
| 时间 | 版本 / 事件 | 关键指标 |
|---|---|---|
| 2024/10 | 发布 Agent S 论文与代码库 | 项目起点 |
| 2025/01 | 论文被 ICLR 2025 接收 | 学术认可 |
| 2025/03 | 发布 Agent S2 与 gui-agents v0.2.0 | 性能超过同期 OpenAI Operator 与 Claude 3.7 Sonnet Computer-Use |
| 2025/04 | 发布 Agent S2 论文 | 在 OSWorld、WindowsAgentArena、AndroidWorld 取得新 SOTA |
| 2025/08 | 发布 Agent S2.5 | 在 OSWorld-Verified 上达到新 SOTA |
| 2025/10 | 发布 Agent S3 及技术论文 | OSWorld 新 SOTA 69.9%,接近约 72% 的人类表现 |
| 2025/12 | Agent S3 超越人类水平 | OSWorld 得分 72.60%,为首个超越人类表现的 CUA |
| 2026/07 | Agent S3 论文被 TMLR 2026 接收 | 方法论文正式发表 |
| 2026/08 | 托管生产版 Sai 登顶 OSWorld 2.0 | 73%,且成本低于同期闭源方案 |
值得说明的是,Agent S3 在 100 步设置下单独运行达到 66%,超过当时的此前最优成绩;引入 Behavior Best-of-N 后进一步提升至 72.6%。这说明单次推理与多次采样择优之间存在显著差距——分数的提升部分来自"多试几次再挑最好的",而这会直接放大推理成本与执行时间。
场景化建议:读基准分数时,重点看三件事——步数预算、是否使用多轮采样、以及测试环境与你的真实环境差异。如果你的任务只允许一次成功执行、且耗时敏感,那么参考的应是单次成绩,而不是加了 Best-of-N 后的上限值。
四、适用场景与不适用场景:把边界说清楚
核心结论:CUA 适合"界面稳定、目标可判定、失败成本可控"的任务;不适合"规则模糊、结果无法自动验证、操作不可逆"的任务。
适合的场景通常具备以下特征:
- 重复频率高:同一套操作每天或每周反复执行,人工时间被大量占用。
- 目标可验证:任务完成后能通过截图比对、文本内容检查或下游数据核对来判断是否成功。
- 界面相对稳定:目标软件版本变更不频繁,或即使变更也不影响核心操作路径。
- 失败可回退:出错后可以撤销、重跑或人工接管,不会造成资金损失或数据污染。
- 无需 API:目标系统确实不提供接口,或申请接口的成本高于自动化收益。
需要谨慎或暂不适用的情况:
- 强合规与审计要求:操作过程需要完整留痕、可追溯,且监管要求人工授权。
- 涉及资金与隐私写入:如支付、转账、删除生产数据、批量修改客户信息。
- 长链路且不可中断:几十步串联、中途失败需从头再来的流程,累积失败率会显著上升。
- 依赖隐性经验判断:需要结合上下文做主观决策的操作,智能体缺乏依据。
- 界面频繁重构:目标系统处于快速迭代期,定位稳定性无法保证。
场景化建议:做场景筛选时,用一个简单问题过滤——"如果它做错了,我多长时间能发现、代价多大?"发现越快、代价越低,越适合作为第一批试点。反之,先做只读任务(如信息汇总、状态查询),再考虑写入类任务。
五、落地前的关键注意事项
在实际引入前,以下几点容易被低估:
- 权限最小化:为智能体准备独立的账号或隔离环境,避免使用拥有全量权限的主账号。
- 人工确认点设计:在高风险步骤(提交、删除、付款)前设置人工确认,把智能体定位为"执行准备者"而非"最终决策者"。
- 成本核算要含重试:多轮采样择优会显著增加调用次数,评估 ROI 时应按"成功一次所需平均尝试次数"计算,而不是按单次调用计价。
- 建立失败样本库:把每次失败的截图与上下文留存下来,这是后续优化定位策略与提示词最有效的素材。
- 区分研究框架与生产方案:开源仓库本身定位为研究框架,项目方也明确将需要托管生产版的用户导向其商业化产品。如果你的场景对稳定性与运维支持有要求,需要提前规划这一层的选择。
- 跨平台差异:框架支持 macOS、Windows 与 Linux,但同一任务在不同系统上的表现可能存在差异,验证阶段应覆盖你实际使用的操作系统。
六、FAQ
Q1. 计算机使用智能体和传统 RPA 有什么区别?
传统 RPA 通常依赖预先配置的界面元素定位与流程编排,界面结构变化时容易失效,需要人工重新维护。计算机使用智能体通过视觉理解当前屏幕状态再决定操作,对界面变化的适应能力更强,且不需要为每个应用单独开发脚本。代价是它的行为带有一定不确定性,需要配合结果校验机制使用。
Q2. Agent S 需要接入哪些模型?是否必须联网?
Agent S 可与 OpenAI、Anthropic 及开源权重提供方的模型配合使用,具体选择取决于你的成本、数据合规与性能要求。如果使用开源权重模型自部署,可以在本地环境中运行;如果调用商业 API,则需要网络连接并考虑数据出境与隐私合规问题。
Q3. OSWorld 得分超过人类,是否意味着可以放心交给它独立操作?
不能直接这样推论。基准测试是在相对标准化的环境中、按明确评分规则进行的,而真实业务环境的界面复杂度、异常分支和权限约束往往更复杂。分数超越人类水平说明能力已达到可用区间,但落地时仍建议保留人工确认点,尤其是涉及写入、删除和资金操作的环节。
Q4. 从零开始验证,第一步应该做什么?
建议选择一个高频、只读、结果易核对的任务作为起点,例如每日从多个后台汇总状态数据。先跑通完整链路,记录成功率、平均耗时与典型失败原因,再逐步过渡到有写入动作的场景。这样能在投入较低的前提下,拿到判断是否继续推进的真实依据。
七、结论
计算机使用智能体解决的是"有界面、没接口"这一层长期被忽视的自动化空白,而 Agent S 是目前公开资料中演进路径较清晰的开源方案之一:从 2024 年 10 月发布,到 Agent S3 在 OSWorld 上以 72.60% 成为首个超越人类表现的 CUA,再到其托管生产版在 OSWorld 2.0 上取得 73% 的成绩,能力提升是可被量化追踪的。
但能力提升不等于可以无条件交付。判断是否引入,关键看三点:任务目标能否自动验证、失败代价是否可控、界面是否足够稳定。三者都满足时,CUA 往往能带来明显的人力释放;任一条不满足,就应先通过隔离环境与人工确认点来降低风险。
下一步建议很具体:挑一个只读、高频、易核对的任务,用 gui-agents 做一次小规模验证,记录成功率与失败模式。这份记录比任何基准分数都更能回答"它是否适合我的业务"。