详细解释
Computer Use(计算机使用,也叫 Desktop Agent / GUI Agent) 是把 LLM Agent 从”调用 API 工具”升级到”直接操作带屏幕的电脑/手机/浏览器”的能力。2024 年 9 月 Anthropic 发布 Claude 3.5 Sonnet Computer Use 是行业第一个真正可用的商用级 GUI Agent 接口,自此它成为 Agent 圈最热的方向之一。
本质上是把”屏幕截图 + 鼠标键盘操作”作为一种新的 Function Calling / Tool 暴露给 LLM:
- 观察:给模型一张”当前屏幕的截图”(或截图 + accessibility tree 语义版 DOM);
- 决策:模型输出下一步动作类型 + 参数(比如
mouse_move到坐标 (x=480, y=270) →left_click→keyboard_type(text='user@weimeta.cn')→ 按回车); - 执行:Agent Runtime(比如 Anthropic 的官方 Computer Use Demo、Open Interpreter、唯元智创 Enterprise SDK)在沙箱环境里真实执行键鼠操作;
- 再观察:截新屏幕 → 回到步骤 1,循环直到完成任务。
Computer Use 的 4 个典型落地场景(已商业化跑通)
| 场景 | 具体任务 | ROI(相比人工) |
|---|---|---|
| RPA 自动化替代 | 登录老旧 ERP 没 API 的系统 → 导 30 张报表 → 汇总 Excel → 发邮件 | 1 个 Agent 顶 3–5 个外包数据录入员 |
| 端到端测试(E2E Testing) | 给需求文档 → 自动生成 Playwright/Selenium 测试脚本 + 跑 + 截失败图 | 节省 QA 80% 的写用例时间 |
| 数据采集(Web 爬虫终极版) | 登录有验证码 + 有 SSO 的后台系统 → 点 10 层菜单 → 导出 CSV | 普通爬虫(requests/Playwright)过不了反爬的它能过 |
| 客户成功陪跑 | “帮我把 CRM 里 300 个客户的标签从 A 迁移到 B,检查重复项” | 秒级完成,替代客户成功团队的机械鼠标活 |
| 软件交付实施 | 给客户装软件 → 初始化配置 → 导入数据 → 冒烟测试 → 交付报告 | 把实施工程师从重复装机里解放出来 |
和传统 Function Calling 的对比
| 维度 | 普通 Function Calling(REST API) | Computer Use(GUI 操作) |
|---|---|---|
| 接入要求 | 需要被操作的系统有 API 接口、有文档、有鉴权 | 什么 API 都不用!只要”你能在屏幕上用鼠标点到”它就能做 |
| 可靠性 | API 返回 JSON 结构化结果,确定性极高(99%+) | 依赖视觉识别 + GUI 元素变化,偶尔点错,需要 Guardrails 兜底 |
| 性能 | 一次调用几十毫秒到几百毫秒 | 一次截图 + 识别 + 点击 3–10 秒 |
| 成本 | 低(几毛钱到几块钱一次业务流程) | 中高(需要多模态模型看截图,tokens 消耗大) |
| 安全风险 | API 权限 + Guardrails 可控 | 需要完整沙箱隔离环境,不能在生产机裸跑 |
最佳实践:能用 API 就用 API(便宜、稳),只有 API 覆盖不到的场景才降级用 Computer Use。两者通过 ReAct 循环组合——比如优先调订单查询 API,查不到再让 Computer Use 去点老旧后台的查询按钮。
安全隔离 4 板斧(用 Computer Use 前必须先做)
- 只在沙箱里跑(Docker / K8s Pod / AWS Workspace):绝对不能在你公司真实的办公机/服务器上直接跑。沙箱用完就销毁。
- 白名单网络:沙箱 egress 网络只能访问 3–5 个你要操作的域名,其他一律阻断。防止 Agent 被注入后去扫内网 / 外传数据。
- 权限最小化账号:给 Computer Use 的登录账号只给它”刚好够做这个任务”的权限。比如做报表导出的账号,绝对不能有”删除数据/审批付款”的权限。
- 每 5 步 + 任务结束前要人审:把 Agent 的”动作序列 + 截图”录屏做成审批单,高敏感任务人类点确认再继续。
- 唯元智创 企业私有化部署版 提供了开箱即用的沙箱 + 权限最小化 + 人审工作流 + 录屏回放,不用你自己从零搭安全基础设施。
常见问题
Computer Use 和 UI 自动化工具 Playwright / Selenium 有啥区别?
区别就是”写死脚本” vs “临场应对”。Playwright:你要先写死”点击 id=submit 的按钮”,哪天按钮改了 id/位置,脚本全坏。Computer Use:你告诉它”提交表单”,它看当前截图自己找”提交”按钮在哪——哪怕你把按钮从左上角移到右下角、换了文案、换了颜色,它基本还能点对。正确姿势:对流程稳定、百年不变的内部系统(如登录首页按钮)用 Playwright(便宜稳);对经常改版、需要灵活决策、没 API 的老旧 GUI 才上 Computer Use。
不同分辨率 / 不同操作系统(Windows vs Mac)会影响它识别吗?
有影响,但厂商已经做了大量处理。标准做法:(1)固定沙箱分辨率为 1920×1080 / 1280×800(训练集主要分辨率);(2)坐标缩放:模型输出的是”相对坐标 0–1000”(比如 x=480/1000 = 屏幕 48% 位置),真实执行时按沙箱实际分辨率缩放,减少分辨率带来的偏移;(3)结合 accessibility tree:同时喂给模型屏幕的”语义 DOM 树”(按钮/输入框/链接的名称、类型、role),多模态视觉 + 语义双通道,鲁棒性大增。
让它操作我的网银 / 后台会不会把钱转走?
只要按上面”安全隔离 4 板斧”做了,风险远低于你让一个新实习生操作。核心是:环境隔离 + 权限最小化 + 人审。反例:给它你自己的管理员账号、直接跑在你每天写代码的电脑上、还让它能访问所有内网——这不是 Computer Use 的问题,这是作死。行业常见配置:只读操作自动跑(查报表/导数据);写/删/支付操作一律暂停等你点确认,你不点它永远停在那里。