Agent 与 Computer Use
Agent 与 Computer Use 前沿论文
Agent 与工作流 和 Agent 架构与多智能体 已介绍 Agent 循环、工具调用、记忆、编排与 AgentOps。本页转向研究论文,重点讨论模型如何在浏览器、桌面和移动端环境中观察界面、选择动作、执行任务并从结果反馈中恢复。
从工具调用到界面操作
ReAct 将推理与行动交替组织:模型先产生当前判断,再调用工具获取观察,继续决定下一步。ReAct: Synergizing Reasoning and Acting in Language Models 说明,环境反馈可以补充模型内部知识,并使轨迹具有可检查性。
Toolformer 研究模型如何学习在合适位置调用计算器、搜索等 API。工具调用的研究重点从“模型能否生成函数名”转向:
- 什么时候调用工具;
- 选择哪个工具;
- 参数是否符合 schema;
- 结果是否被正确解释;
- 工具副作用失败后能否重试或回滚。
Computer Use 把工具接口从结构化 API 推广到屏幕和鼠标键盘。模型必须从像素或无障碍树理解当前界面,再输出点击、输入、滚动、拖拽和快捷键等动作。
产品化 Computer Use
2024–2026 年,Computer Use 从 benchmark 进入产品:模型接收屏幕截图(有时加无障碍树),在桌面或浏览器里执行点击与键入,并在支付、删除、发信前要求确认。产品化要单独验收三件事:感知输入(分辨率、多显示器、暗色主题)、动作空间(坐标 vs 元素 ID)、安全确认(不可逆操作的人工闸门)。不要把 WebArena 成功率直接当成线上 Computer Use 能力。
GUI grounding 与动作表示
GUI Agent 至少包含三个环节:
1 2 3 4 5 6 7 | |
动作表示可以是:
| 表示 | 优点 | 局限 |
|---|---|---|
| 坐标动作 | 适用于任意画面,接口简单 | 分辨率、窗口和布局变化敏感 |
| 元素 ID | 可解释、易验证、适合结构化网页 | 依赖 DOM 或无障碍树质量 |
| 语言动作 | 便于跨应用迁移 | 需要额外执行器解析 |
| 轨迹或宏 | 可复用完整流程 | 环境变化后容易失效 |
SeeClick 研究视觉 GUI grounding,代表一类将屏幕理解和元素定位统一到视觉语言模型中的路线。评估时要分开测量定位正确率和任务最终成功率:元素框点对了,不等于整个任务完成。
浏览器环境与 benchmark
Mind2Web 提供跨网站、跨任务的网页操作数据,关注模型从自然语言指令定位网页元素并完成动作。
WebArena 构造更接近真实网站的可执行环境,包含搜索、论坛、购物和内容管理等任务。它的价值在于让模型面对状态变化、页面导航、登录态和多步依赖,而不只是预测下一次点击。
浏览器 Agent 的论文结果需要核对:
- 测试网站是否在训练轨迹中出现;
- 环境数据和网页内容是否固定;
- 任务是否要求多步状态变更;
- 成功是页面达到终态,还是动作序列与标注相似;
- 失败后是否允许重新规划。
桌面、移动端与软件工程环境
OSWorld 将 Agent 放入真实操作系统任务中,涵盖办公软件、浏览器、文件管理和系统设置。与网页任务相比,桌面环境有更多隐含状态:窗口焦点、剪贴板、文件路径、权限弹窗和应用版本都会影响结果。
AndroidWorld 研究移动端应用中的多步操作。移动端额外引入屏幕尺寸、触控手势、返回栈、通知和跨应用跳转等约束。
SWE-bench 把软件仓库中的真实 issue 作为 Agent 任务。它的验收不是“代码看起来合理”,而是补丁能否在目标仓库测试中通过,并保持原有行为。
这些 benchmark 共同推动了评测口径的变化:
| 旧式评测 | Agent 评测 |
|---|---|
| 单轮答案准确率 | 任务终态成功率 |
| 文本相似度 | 环境状态是否正确改变 |
| 一次生成 | 多步轨迹与恢复 |
| 平均分 | 成功率、成本和长尾 |
| 无副作用 | 工具和界面动作的实际副作用 |
任务恢复与执行安全
Computer Use 不是只要提高视觉识别率。生产系统还需要:
- 幂等性:重复点击不会重复下单、重复发送或重复删除;
- 动作前确认:支付、发布、删除和权限变更前显示即将执行的动作;
- 状态校验:每步执行前确认窗口、账号、对象和权限仍正确;
- 失败恢复:找不到元素时回退、重新截图或请求人工接管;
- 最小权限:Agent 只获得完成当前任务所需的账号和应用权限;
- 轨迹审计:保存观察、动作、结果、错误和人工干预记录。
错误成本不对称时,系统应宁可停下来请求确认,也不要盲目探索。自动化程度必须和可逆性、权限范围和用户可观察性一起设计。
Computer Use 的评测协议
建议为每个任务记录:
- 初始环境快照和账号权限;
- 目标状态的机器可判定定义;
- 允许的操作集合和最大步数;
- 每一步截图、动作和环境反馈;
- 最终成功、部分成功、失败和人工接管原因;
- 任务耗时、模型 token、工具调用次数和重试次数。
核心指标包括终态成功率、步骤效率、定位错误率、不可恢复失败率、危险动作拦截率和人工接管率。平均完成率不能掩盖少数高风险任务的严重副作用。
给 AI 产品经理的结论
Agent 与 Computer Use 适合流程变化多、传统 API 覆盖不足、但环境状态可以自动验证的任务。上线顺序建议从只读、可回滚、低权限任务开始,再逐步扩展到写入和跨应用操作。模型 benchmark 提升只能证明潜在能力,不能替代真实账号、真实数据和真实副作用环境中的验收。
来源说明
本文为原创整理,引用日期:2026-09-04。基础概念参见 Agent 与工作流 与 Agent 架构与多智能体。主要来源包括 ReAct、Toolformer、Mind2Web、WebArena、OSWorld、AndroidWorld 与 SWE-bench。产品化 Computer Use 的感知、动作与确认机制以各厂商官方文档为准。
发现错误?想一起完善? 在 GitHub 上编辑此页!
本页面贡献者:AI-PM Wiki Team
本页面的全部内容在 CC BY-SA 4.0 和 SATA 协议之条款下提供,附加条款亦可能应用