跳转至

Agent 与 Computer Use

Agent 与 Computer Use 前沿论文

Agent 与工作流Agent 架构与多智能体 已介绍 Agent 循环、工具调用、记忆、编排与 AgentOps。本页转向研究论文,重点讨论模型如何在浏览器、桌面和移动端环境中观察界面、选择动作、执行任务并从结果反馈中恢复。

从工具调用到界面操作

ReAct 将推理与行动交替组织:模型先产生当前判断,再调用工具获取观察,继续决定下一步。ReAct: Synergizing Reasoning and Acting in Language Models 说明,环境反馈可以补充模型内部知识,并使轨迹具有可检查性。

Toolformer 研究模型如何学习在合适位置调用计算器、搜索等 API。工具调用的研究重点从“模型能否生成函数名”转向:

  • 什么时候调用工具;
  • 选择哪个工具;
  • 参数是否符合 schema;
  • 结果是否被正确解释;
  • 工具副作用失败后能否重试或回滚。

Computer Use 把工具接口从结构化 API 推广到屏幕和鼠标键盘。模型必须从像素或无障碍树理解当前界面,再输出点击、输入、滚动、拖拽和快捷键等动作。

产品化 Computer Use

2024–2026 年,Computer Use 从 benchmark 进入产品:模型接收屏幕截图(有时加无障碍树),在桌面或浏览器里执行点击与键入,并在支付、删除、发信前要求确认。产品化要单独验收三件事:感知输入(分辨率、多显示器、暗色主题)、动作空间(坐标 vs 元素 ID)、安全确认(不可逆操作的人工闸门)。不要把 WebArena 成功率直接当成线上 Computer Use 能力。

GUI grounding 与动作表示

GUI Agent 至少包含三个环节:

1
2
3
4
5
6
7
屏幕截图 / DOM / 无障碍树
        ↓
元素定位与任务状态理解
        ↓
点击、输入、滚动、拖拽或键盘动作
        ↓
新页面状态与执行结果

动作表示可以是:

表示优点局限
坐标动作适用于任意画面,接口简单分辨率、窗口和布局变化敏感
元素 ID可解释、易验证、适合结构化网页依赖 DOM 或无障碍树质量
语言动作便于跨应用迁移需要额外执行器解析
轨迹或宏可复用完整流程环境变化后容易失效

SeeClick 研究视觉 GUI grounding,代表一类将屏幕理解和元素定位统一到视觉语言模型中的路线。评估时要分开测量定位正确率和任务最终成功率:元素框点对了,不等于整个任务完成。

浏览器环境与 benchmark

Mind2Web 提供跨网站、跨任务的网页操作数据,关注模型从自然语言指令定位网页元素并完成动作。

WebArena 构造更接近真实网站的可执行环境,包含搜索、论坛、购物和内容管理等任务。它的价值在于让模型面对状态变化、页面导航、登录态和多步依赖,而不只是预测下一次点击。

浏览器 Agent 的论文结果需要核对:

  • 测试网站是否在训练轨迹中出现;
  • 环境数据和网页内容是否固定;
  • 任务是否要求多步状态变更;
  • 成功是页面达到终态,还是动作序列与标注相似;
  • 失败后是否允许重新规划。

桌面、移动端与软件工程环境

OSWorld 将 Agent 放入真实操作系统任务中,涵盖办公软件、浏览器、文件管理和系统设置。与网页任务相比,桌面环境有更多隐含状态:窗口焦点、剪贴板、文件路径、权限弹窗和应用版本都会影响结果。

AndroidWorld 研究移动端应用中的多步操作。移动端额外引入屏幕尺寸、触控手势、返回栈、通知和跨应用跳转等约束。

SWE-bench 把软件仓库中的真实 issue 作为 Agent 任务。它的验收不是“代码看起来合理”,而是补丁能否在目标仓库测试中通过,并保持原有行为。

这些 benchmark 共同推动了评测口径的变化:

旧式评测Agent 评测
单轮答案准确率任务终态成功率
文本相似度环境状态是否正确改变
一次生成多步轨迹与恢复
平均分成功率、成本和长尾
无副作用工具和界面动作的实际副作用

任务恢复与执行安全

Computer Use 不是只要提高视觉识别率。生产系统还需要:

  • 幂等性:重复点击不会重复下单、重复发送或重复删除;
  • 动作前确认:支付、发布、删除和权限变更前显示即将执行的动作;
  • 状态校验:每步执行前确认窗口、账号、对象和权限仍正确;
  • 失败恢复:找不到元素时回退、重新截图或请求人工接管;
  • 最小权限:Agent 只获得完成当前任务所需的账号和应用权限;
  • 轨迹审计:保存观察、动作、结果、错误和人工干预记录。

错误成本不对称时,系统应宁可停下来请求确认,也不要盲目探索。自动化程度必须和可逆性、权限范围和用户可观察性一起设计。

Computer Use 的评测协议

建议为每个任务记录:

  1. 初始环境快照和账号权限;
  2. 目标状态的机器可判定定义;
  3. 允许的操作集合和最大步数;
  4. 每一步截图、动作和环境反馈;
  5. 最终成功、部分成功、失败和人工接管原因;
  6. 任务耗时、模型 token、工具调用次数和重试次数。

核心指标包括终态成功率、步骤效率、定位错误率、不可恢复失败率、危险动作拦截率和人工接管率。平均完成率不能掩盖少数高风险任务的严重副作用。

给 AI 产品经理的结论

Agent 与 Computer Use 适合流程变化多、传统 API 覆盖不足、但环境状态可以自动验证的任务。上线顺序建议从只读、可回滚、低权限任务开始,再逐步扩展到写入和跨应用操作。模型 benchmark 提升只能证明潜在能力,不能替代真实账号、真实数据和真实副作用环境中的验收。

来源说明

本文为原创整理,引用日期:2026-09-04。基础概念参见 Agent 与工作流Agent 架构与多智能体。主要来源包括 ReActToolformerMind2WebWebArenaOSWorldAndroidWorldSWE-bench。产品化 Computer Use 的感知、动作与确认机制以各厂商官方文档为准。