计算机使用工具调用

Computer Use

Computer Use 计算机使用是 2024 年下半年以来的 Agent 新能力:模型不再只输出文字回答,而是像真人一样操作图形界面(点击、输入、滚动、快捷键、打开文件、写代码运行等),典型实现是 Anthropic Claude 3.5 Computer Use、OpenAI Operator 系列。

详细解释

Computer Use(计算机使用,也叫 Desktop Agent / GUI Agent) 是把 LLM Agent 从”调用 API 工具”升级到”直接操作带屏幕的电脑/手机/浏览器”的能力。2024 年 9 月 Anthropic 发布 Claude 3.5 Sonnet Computer Use 是行业第一个真正可用的商用级 GUI Agent 接口,自此它成为 Agent 圈最热的方向之一。

本质上是把”屏幕截图 + 鼠标键盘操作”作为一种新的 Function Calling / Tool 暴露给 LLM:

  1. 观察:给模型一张”当前屏幕的截图”(或截图 + accessibility tree 语义版 DOM);
  2. 决策:模型输出下一步动作类型 + 参数(比如 mouse_move 到坐标 (x=480, y=270) → left_clickkeyboard_type(text='user@weimeta.cn') → 按回车);
  3. 执行:Agent Runtime(比如 Anthropic 的官方 Computer Use Demo、Open Interpreter、唯元智创 Enterprise SDK)在沙箱环境里真实执行键鼠操作;
  4. 再观察:截新屏幕 → 回到步骤 1,循环直到完成任务。

Computer Use 的 4 个典型落地场景(已商业化跑通)

场景具体任务ROI(相比人工)
RPA 自动化替代登录老旧 ERP 没 API 的系统 → 导 30 张报表 → 汇总 Excel → 发邮件1 个 Agent 顶 3–5 个外包数据录入员
端到端测试(E2E Testing)给需求文档 → 自动生成 Playwright/Selenium 测试脚本 + 跑 + 截失败图节省 QA 80% 的写用例时间
数据采集(Web 爬虫终极版)登录有验证码 + 有 SSO 的后台系统 → 点 10 层菜单 → 导出 CSV普通爬虫(requests/Playwright)过不了反爬的它能过
客户成功陪跑“帮我把 CRM 里 300 个客户的标签从 A 迁移到 B,检查重复项”秒级完成,替代客户成功团队的机械鼠标活
软件交付实施给客户装软件 → 初始化配置 → 导入数据 → 冒烟测试 → 交付报告把实施工程师从重复装机里解放出来

和传统 Function Calling 的对比

维度普通 Function Calling(REST API)Computer Use(GUI 操作)
接入要求需要被操作的系统有 API 接口、有文档、有鉴权什么 API 都不用!只要”你能在屏幕上用鼠标点到”它就能做
可靠性API 返回 JSON 结构化结果,确定性极高(99%+)依赖视觉识别 + GUI 元素变化,偶尔点错,需要 Guardrails 兜底
性能一次调用几十毫秒到几百毫秒一次截图 + 识别 + 点击 3–10 秒
成本低(几毛钱到几块钱一次业务流程)中高(需要多模态模型看截图,tokens 消耗大)
安全风险API 权限 + Guardrails 可控需要完整沙箱隔离环境,不能在生产机裸跑

最佳实践:能用 API 就用 API(便宜、稳),只有 API 覆盖不到的场景才降级用 Computer Use。两者通过 ReAct 循环组合——比如优先调订单查询 API,查不到再让 Computer Use 去点老旧后台的查询按钮。

安全隔离 4 板斧(用 Computer Use 前必须先做)

  1. 只在沙箱里跑(Docker / K8s Pod / AWS Workspace):绝对不能在你公司真实的办公机/服务器上直接跑。沙箱用完就销毁。
  2. 白名单网络:沙箱 egress 网络只能访问 3–5 个你要操作的域名,其他一律阻断。防止 Agent 被注入后去扫内网 / 外传数据。
  3. 权限最小化账号:给 Computer Use 的登录账号只给它”刚好够做这个任务”的权限。比如做报表导出的账号,绝对不能有”删除数据/审批付款”的权限。
  4. 每 5 步 + 任务结束前要人审:把 Agent 的”动作序列 + 截图”录屏做成审批单,高敏感任务人类点确认再继续。
  5. 唯元智创 企业私有化部署版 提供了开箱即用的沙箱 + 权限最小化 + 人审工作流 + 录屏回放,不用你自己从零搭安全基础设施。

常见问题

Computer Use 和 UI 自动化工具 Playwright / Selenium 有啥区别?
区别就是”写死脚本” vs “临场应对”。Playwright:你要先写死”点击 id=submit 的按钮”,哪天按钮改了 id/位置,脚本全坏。Computer Use:你告诉它”提交表单”,它看当前截图自己找”提交”按钮在哪——哪怕你把按钮从左上角移到右下角、换了文案、换了颜色,它基本还能点对。正确姿势:对流程稳定、百年不变的内部系统(如登录首页按钮)用 Playwright(便宜稳);对经常改版、需要灵活决策、没 API 的老旧 GUI 才上 Computer Use。
不同分辨率 / 不同操作系统(Windows vs Mac)会影响它识别吗?
有影响,但厂商已经做了大量处理。标准做法:(1)固定沙箱分辨率为 1920×1080 / 1280×800(训练集主要分辨率);(2)坐标缩放:模型输出的是”相对坐标 0–1000”(比如 x=480/1000 = 屏幕 48% 位置),真实执行时按沙箱实际分辨率缩放,减少分辨率带来的偏移;(3)结合 accessibility tree:同时喂给模型屏幕的”语义 DOM 树”(按钮/输入框/链接的名称、类型、role),多模态视觉 + 语义双通道,鲁棒性大增。
让它操作我的网银 / 后台会不会把钱转走?
只要按上面”安全隔离 4 板斧”做了,风险远低于你让一个新实习生操作。核心是:环境隔离 + 权限最小化 + 人审。反例:给它你自己的管理员账号、直接跑在你每天写代码的电脑上、还让它能访问所有内网——这不是 Computer Use 的问题,这是作死。行业常见配置:只读操作自动跑(查报表/导数据);写/删/支付操作一律暂停等你点确认,你不点它永远停在那里。