
老铁们,有没有想过,如果AI不仅能帮你写代码、查资料,还能直接上手操作你的电脑——鼠标点点、键盘敲敲,替你完成一堆繁琐的任务,那会是什么光景?别急,Computer-Use 2.0已经把这事儿给整清楚了。而咱们Hermes Agent,恰好就是那个能驾驭这套玩法的狠角色。今天咱们就掰开揉碎了聊聊天。
一、Computer-Use 2.0到底是啥玩意儿?
先说个大白话:
Computer-Use 2.0就是一种让AI Agent操作真实电脑的”新姿势”。
它不是让AI像以前那样光盯着截图点点鼠标——那是”Computer-Use 1.0″,有点类似让一个瞎子摸象,只能靠屏幕截图猜按钮在哪,效率低得一批。
而2.0版本则完全不同了。AI可以通过
三种行动方式
来操作电脑,就像一个人左手写代码、右手调API、嘴巴还能直接跟图形界面对话一样。这三种方式合在一起,才是真正的全能型选手。
说人话就是:
AI终于从”看图猜按钮”的智障阶段,进化到了”既能写代码又能点鼠标还能调接口”的全栈阶段了。
二、三大行动面:AI的三块”键盘”
行动面一:代码面——让AI当程序员
在这个面上,AI直接
写代码并执行代码
,代码本身就是它的操作。
这招特别适合以下场景:
文本类任务:列如批量重命名文件、处理日志、转换格式,写个脚本比人干快十倍
重复性操作:要是同一件事要干一遍又一遍,让AI写个循环搞定,比你加班到半夜强多了
大规模操作:一个小脚本就能操作一大批文件和状态,人手工干估计手都得抖
打个比方:让你手动把1000个文件的文件名从”新建文档(1).txt”改成”报告001.txt”到”报告1000.txt”,你干到猴年马月?AI写个for循环,0.1秒完事——这就是代码面的威力。
行动面二:工具调用面——让AI当接口工程师
在这个面上,AI不是写脚本,而是
直接调用工具、函数、API和MCP服务器
关键点在于:这些调用是有明确数据类型的。
也就是说,AI调用一个API时,它知道输入参数叫什么名字、返回数据长什么样。它不需要凭空编一个脚本,也不需要靠截图猜按钮——直接通过结构化的方式让外部系统执行一个具体操作。
打个比方:AI想查一下账户余额,它不需要打开浏览器、登录网页、找到余额页面然后截图分析——它直接调个API,参数传好,返回值到手。优雅,太优雅了。
行动面三:UI自动化面——让AI当人类用户
在这个面上,AI像人一样
点击、打字、滚动、按键盘
,操作的是一个你平时用的图形界面。
这是唯一一个能触达以下系统的”杀手锏”:
原生桌面应用:列如Word、Excel、Adobe系列
Web应用:各种浏览器里跑的网站
企业软件和遗留系统:那些老板们用了二十年舍不得换的老系统
没有API的系统:有些系统就是没有任何接口,GUI是它暴露给用户的唯一通道
说白了,这就是Computer-Use最初的概念——AI看着屏幕截图,然后用鼠标和键盘操作。但它目前只是三个面中的一个,而且是最”兜底”的那一个。
打个比方:你要在某个破旧的政府网站上填表,这个网站连个API都没有,唯一的入口就是网页。这时候代码面没用,工具调用面也没戏,只能靠UI自动化面——AI直接操作浏览器,像人一样填表。
三、怎么选?AI的”判断力”才是真本事
一个厉害的AI Agent,在一次任务中会在
三个面之间自由切换
,选最适合的那一个。
什么时候用代码?
任务可重复执行、文本处理量大、系统有清晰的接口
什么时候用工具调用?
有现成的API可用、结构化数据交互
什么时候用UI自动化?
任务依赖视觉状态(你得看看页面长啥样)、面对不熟悉的应用、没有可用的API,操作路径只存在于界面里
真正的本事在于判断力。
举个栗子:假设你要完成”把某个系统的数据导出来”的任务,一个机智的AI可能会这么做:
代码面:写个脚本读取本地文件
工具调用面:调API查账户状态,确认数据权限
UI自动化面:打开一个桌面应用,在设置里改一下导出选项
你看,虽然用了三种不同的”键盘”,但整个过程中AI只做了一件事——
完成一个电脑任务。
它只是根据任务的不同阶段,灵活切换了不同的行动面而已。
这就好比一个人做饭:切菜用刀(代码面),炒菜用锅(工具调用面),摆盘用手(UI自动化面)。工具不同,但都在做同一件事。
四、UI自动化循环:观察-决策-行动的”铁三角”
这是专门属于
UI自动化面
的工作流程,可以拆成三步:
第一步:观察(Observe)
AI怎么”看”屏幕?有两种方式:
截图:就像人眼睛看到的像素画面
无障碍树(Accessibility Tree):操作系统暴露出来的结构化信息,告知你当前页面上有哪些按钮、文本框、菜单
或者两种都用,双管齐下。
第二步:落地(Grounding)
光看到”有个按钮”不够,AI还得知道这个按钮在屏幕上的
具体坐标
,这样才能用鼠标点中它。
“落地”就是把一个目标——列如一个按钮、一个输入框、一个菜单项——转换成屏幕上准确的像素坐标,让输入事件(鼠标点击、键盘输入)能准确命中。
打个比方:你知道餐厅有个”红烧肉”,但不知道它在菜单第几行第几个。落地就是帮你把菜单翻到那一页,用荧光笔把”红烧肉”三个字标出来。
第三步:规划(Planning)
这才是最烧脑的部分。
由于界面状态一直在变。
你点一下,弹出一个对话框
页面加载完,布局变了
程序报错,按钮颜色都变了
AI得在计算机不断变化的响应中,始终记住自己的目标是什么。
前沿模型(列如Claude)可以在
一次调用中同时搞定理解、落地和规划
。而专门的落地模型(列如UI-TARS、Moondream)则在坐标精度是瓶颈时提供额外协助。
Computer-Use的前世今生
说个历史小八卦:Computer-Use这个概念最原始的形态,出目前
2024年10月
,当时Anthropic(也就是搞Claude那家公司)推出了一个能通过截图和输入事件操作GUI的Agent。
2025年,代码Agent逐渐被认可为Computer-Use Agent。CoAct-1论文更是直接把这两者联系在了一起。慢慢地,整个领域开始把视野放大,形成了目前这个更宽泛的概念——
Computer-Use 2.0
Francesco Bonacci在 A Story of Computer-Use 这篇文章里详细梳理了这段发展史,感兴趣的老铁可以去看看。
五、Cua在哪?Hermes Agent怎么上车?
到这里你可能会问:所以Cua是个啥玩意儿?跟咱们Hermes Agent有啥关系?
简单说:
你负责带来一个Agent(列如Hermes Agent),它本身就能写代码、调工具。Cua给它补上了最后一个拼图——UI自动化能力和一台真正的电脑。
这样一来,同一个任务就可以在代码、工具调用、图形界面之间自由流转,根据应用的实际需求灵活选择最合适的操作方式。
Cua提供了两套工具:
Cua Driver:驱动你已有的电脑
Cua Driver可以驱动你
已经拥有的真实电脑
的GUI,不管这台机器跑的是macOS、Windows还是Linux。
适合的场景:
Agent需要操作本地应用程序
需要登录已登录的账号
需要访问电脑上已有的文件
需要操作已经存在于这台电脑上的机器状态
打个比方:你的工作电脑上装了一堆公司内部的破系统,要登录、要操作、要导出报表。Cua Driver就能直接操控你的桌面,让AI像人一样在这些系统里操作。
Cua Sandbox:云端沙盒电脑
Cua Sandbox是一个
全新的、隔离的云端电脑
。Agent可以在里面同时运行代码和驱动GUI。
它跟远程桌面的关键区别在于:
它是一个完整的计算机环境,三个行动面(代码、工具调用、UI自动化)都在同一个环境里可用
,而不是一个只能看到界面的远程桌面。
适合的场景:
任务既需要编程工作又需要可视化的交互操作
不想触碰本地机器
需要干净隔离的环境
打个比方:你想让AI帮你跑一堆自动化测试,但又不想污染自己的电脑。那就开一个Cua Sandbox,AI在云端沙盒里又写代码又点界面,干完活沙盒一销毁,干干净净。
六、总结一下:Hermes Agent × Computer-Use 2.0到底强在哪?
说一千道一万,核心就一句话:
Hermes Agent 加上 Computer-Use 2.0 的能力,等于一个既能写代码、又能调API、还能操作图形界面的全能AI助手。
它不是”看起来像人一样操作电脑的智障”,而是
真正理解任务、智能选择最优操作方式、在三种行动面之间灵活切换的机智AI
后来再也不用跟那些”没有API、只能用图形界面”的老系统较劲了——让AI去操作就行。





