Hermes Agent与Computer-Use 2.0:AI终于学会自己操作电脑了

内容分享1周前发布
10 1 0

Hermes Agent与Computer-Use 2.0:AI终于学会自己操作电脑了

老铁们,有没有想过,如果AI不仅能帮你写代码、查资料,还能直接上手操作你的电脑——鼠标点点、键盘敲敲,替你完成一堆繁琐的任务,那会是什么光景?别急,Computer-Use 2.0已经把这事儿给整清楚了。而咱们Hermes Agent,恰好就是那个能驾驭这套玩法的狠角色。今天咱们就掰开揉碎了聊聊天。

一、Computer-Use 2.0到底是啥玩意儿?

先说个大白话:

Computer-Use 2.0就是一种让AI Agent操作真实电脑的”新姿势”。

它不是让AI像以前那样光盯着截图点点鼠标——那是”Computer-Use 1.0″,有点类似让一个瞎子摸象,只能靠屏幕截图猜按钮在哪,效率低得一批。

而2.0版本则完全不同了。AI可以通过

三种行动方式

来操作电脑,就像一个人左手写代码、右手调API、嘴巴还能直接跟图形界面对话一样。这三种方式合在一起,才是真正的全能型选手。

说人话就是:

AI终于从”看图猜按钮”的智障阶段,进化到了”既能写代码又能点鼠标还能调接口”的全栈阶段了。

二、三大行动面:AI的三块”键盘”

行动面一:代码面——让AI当程序员

在这个面上,AI直接

写代码并执行代码

,代码本身就是它的操作。

这招特别适合以下场景:

文本类任务:列如批量重命名文件、处理日志、转换格式,写个脚本比人干快十倍

重复性操作:要是同一件事要干一遍又一遍,让AI写个循环搞定,比你加班到半夜强多了

大规模操作:一个小脚本就能操作一大批文件和状态,人手工干估计手都得抖

打个比方:让你手动把1000个文件的文件名从”新建文档(1).txt”改成”报告001.txt”到”报告1000.txt”,你干到猴年马月?AI写个for循环,0.1秒完事——这就是代码面的威力。

行动面二:工具调用面——让AI当接口工程师

在这个面上,AI不是写脚本,而是

直接调用工具、函数、API和MCP服务器

关键点在于:这些调用是有明确数据类型的。

也就是说,AI调用一个API时,它知道输入参数叫什么名字、返回数据长什么样。它不需要凭空编一个脚本,也不需要靠截图猜按钮——直接通过结构化的方式让外部系统执行一个具体操作。

打个比方:AI想查一下账户余额,它不需要打开浏览器、登录网页、找到余额页面然后截图分析——它直接调个API,参数传好,返回值到手。优雅,太优雅了。

行动面三:UI自动化面——让AI当人类用户

在这个面上,AI像人一样

点击、打字、滚动、按键盘

,操作的是一个你平时用的图形界面。

这是唯一一个能触达以下系统的”杀手锏”:

原生桌面应用:列如Word、Excel、Adobe系列

Web应用:各种浏览器里跑的网站

企业软件和遗留系统:那些老板们用了二十年舍不得换的老系统

没有API的系统:有些系统就是没有任何接口,GUI是它暴露给用户的唯一通道

说白了,这就是Computer-Use最初的概念——AI看着屏幕截图,然后用鼠标和键盘操作。但它目前只是三个面中的一个,而且是最”兜底”的那一个。

打个比方:你要在某个破旧的政府网站上填表,这个网站连个API都没有,唯一的入口就是网页。这时候代码面没用,工具调用面也没戏,只能靠UI自动化面——AI直接操作浏览器,像人一样填表。

三、怎么选?AI的”判断力”才是真本事

一个厉害的AI Agent,在一次任务中会在

三个面之间自由切换

,选最适合的那一个。

什么时候用代码?

任务可重复执行、文本处理量大、系统有清晰的接口

什么时候用工具调用?

有现成的API可用、结构化数据交互

什么时候用UI自动化?

任务依赖视觉状态(你得看看页面长啥样)、面对不熟悉的应用、没有可用的API,操作路径只存在于界面里

真正的本事在于判断力。

举个栗子:假设你要完成”把某个系统的数据导出来”的任务,一个机智的AI可能会这么做:

代码面:写个脚本读取本地文件

工具调用面:调API查账户状态,确认数据权限

UI自动化面:打开一个桌面应用,在设置里改一下导出选项

你看,虽然用了三种不同的”键盘”,但整个过程中AI只做了一件事——

完成一个电脑任务。

它只是根据任务的不同阶段,灵活切换了不同的行动面而已。

这就好比一个人做饭:切菜用刀(代码面),炒菜用锅(工具调用面),摆盘用手(UI自动化面)。工具不同,但都在做同一件事。

四、UI自动化循环:观察-决策-行动的”铁三角”

这是专门属于

UI自动化面

的工作流程,可以拆成三步:

第一步:观察(Observe)

AI怎么”看”屏幕?有两种方式:

截图:就像人眼睛看到的像素画面

无障碍树(Accessibility Tree):操作系统暴露出来的结构化信息,告知你当前页面上有哪些按钮、文本框、菜单

或者两种都用,双管齐下。

第二步:落地(Grounding)

光看到”有个按钮”不够,AI还得知道这个按钮在屏幕上的

具体坐标

,这样才能用鼠标点中它。

“落地”就是把一个目标——列如一个按钮、一个输入框、一个菜单项——转换成屏幕上准确的像素坐标,让输入事件(鼠标点击、键盘输入)能准确命中。

打个比方:你知道餐厅有个”红烧肉”,但不知道它在菜单第几行第几个。落地就是帮你把菜单翻到那一页,用荧光笔把”红烧肉”三个字标出来。

第三步:规划(Planning)

这才是最烧脑的部分。

由于界面状态一直在变。

你点一下,弹出一个对话框

页面加载完,布局变了

程序报错,按钮颜色都变了

AI得在计算机不断变化的响应中,始终记住自己的目标是什么。

前沿模型(列如Claude)可以在

一次调用中同时搞定理解、落地和规划

。而专门的落地模型(列如UI-TARS、Moondream)则在坐标精度是瓶颈时提供额外协助。

Computer-Use的前世今生

说个历史小八卦:Computer-Use这个概念最原始的形态,出目前

2024年10月

,当时Anthropic(也就是搞Claude那家公司)推出了一个能通过截图和输入事件操作GUI的Agent。

2025年,代码Agent逐渐被认可为Computer-Use Agent。CoAct-1论文更是直接把这两者联系在了一起。慢慢地,整个领域开始把视野放大,形成了目前这个更宽泛的概念——

Computer-Use 2.0

Francesco Bonacci在 A Story of Computer-Use 这篇文章里详细梳理了这段发展史,感兴趣的老铁可以去看看。

五、Cua在哪?Hermes Agent怎么上车?

到这里你可能会问:所以Cua是个啥玩意儿?跟咱们Hermes Agent有啥关系?

简单说:

你负责带来一个Agent(列如Hermes Agent),它本身就能写代码、调工具。Cua给它补上了最后一个拼图——UI自动化能力和一台真正的电脑。

这样一来,同一个任务就可以在代码、工具调用、图形界面之间自由流转,根据应用的实际需求灵活选择最合适的操作方式。

Cua提供了两套工具:

Cua Driver:驱动你已有的电脑

Cua Driver可以驱动你

已经拥有的真实电脑

的GUI,不管这台机器跑的是macOS、Windows还是Linux。

适合的场景:

Agent需要操作本地应用程序

需要登录已登录的账号

需要访问电脑上已有的文件

需要操作已经存在于这台电脑上的机器状态

打个比方:你的工作电脑上装了一堆公司内部的破系统,要登录、要操作、要导出报表。Cua Driver就能直接操控你的桌面,让AI像人一样在这些系统里操作。

Cua Sandbox:云端沙盒电脑

Cua Sandbox是一个

全新的、隔离的云端电脑

。Agent可以在里面同时运行代码和驱动GUI。

它跟远程桌面的关键区别在于:

它是一个完整的计算机环境,三个行动面(代码、工具调用、UI自动化)都在同一个环境里可用

,而不是一个只能看到界面的远程桌面。

适合的场景:

任务既需要编程工作又需要可视化的交互操作

不想触碰本地机器

需要干净隔离的环境

打个比方:你想让AI帮你跑一堆自动化测试,但又不想污染自己的电脑。那就开一个Cua Sandbox,AI在云端沙盒里又写代码又点界面,干完活沙盒一销毁,干干净净。

六、总结一下:Hermes Agent × Computer-Use 2.0到底强在哪?

说一千道一万,核心就一句话:

Hermes Agent 加上 Computer-Use 2.0 的能力,等于一个既能写代码、又能调API、还能操作图形界面的全能AI助手。

它不是”看起来像人一样操作电脑的智障”,而是

真正理解任务、智能选择最优操作方式、在三种行动面之间灵活切换的机智AI

后来再也不用跟那些”没有API、只能用图形界面”的老系统较劲了——让AI去操作就行。

© 版权声明

相关文章

1 条评论

none
暂无评论...