我一直觉得,让 AI 只会聊天有点浪费。很多事情明明已经打开网页了,最后一步却还得我自己点:搜索、填写、切换页面、提交。

BrowserSkill 做的事情很直接,让 AI 真正接入浏览器。

它不是给浏览器套一个聊天窗口,而是通过 bsk CLI 和浏览器扩展建立连接,再让 AI 去观察页面、理解页面上的控件,然后执行点击、输入和选择等动作。

BrowserSkill 是怎么工作的

BrowserSkill 需要两个东西:一个是安装在电脑上的 bsk 命令行工具,另一个是加载到 Chromium 中的 browser-skill 扩展。扩展连接成功后,浏览器里会显示绿色状态。

浏览器扩展

扩展窗口

AI 发起任务时,BrowserSkill 会打开一个独立的 Agent Window。这个窗口和用户正在使用的浏览器窗口分开,AI 默认只操作自己的标签页。需要操作用户现有页面时,也可以先把指定标签页借用进来,完成后再归还。

这个隔离设计我比较喜欢。AI 要跑网页任务,就让它在自己的窗口里跑,不会突然把我正在看的网页刷新掉。

先观察,再操作

BrowserSkill 的基本工作流是:

1
2
3
4
5
6
bsk session start
bsk observe
bsk snapshot
bsk click / fill / select
bsk observe
bsk session stop

observe 用来获取页面的语义信息,能看到页面文字、按钮、输入框以及可交互控件。snapshot 则是更严格的无障碍树快照,适合在页面结构比较复杂时使用。

AI 先观察页面,再根据按钮名称或输入框的作用执行操作。网页改版后,元素位置可能变了,但只要按钮文字和页面结构没有完全改变,AI 仍然有机会找到正确的目标。

当然,它也不是开了挂。验证码、登录、短信验证和支付确认这类步骤,还是应该停下来交给人处理。任务完成后要及时结束 session,不要让 AI 长时间接管浏览器。

最有意思的功能:录制动作教 AI 学习

BrowserSkill 里我觉得最有意思的是 bsk record

功能按钮

操作录制

有些网页操作很难用语言描述。比如先打开某个后台,进入指定菜单,筛选日期,再点击导出。你可以写一大段说明,但 AI 还是可能漏掉中间某一步。

这时候可以直接录制。

指令可以让ai来操作。你填写完点击复制即可。

操作指令

然后像平时一样操作网页,完成后点击录制面板里的 Finish。BrowserSkill 会生成一个 trace bundle,里面至少包含 trace.json,新版本还会保存 states/ 目录。

trace.json 里有动作链,每一步还会关联操作前后的页面状态。states/ 里保存页面观察结果,所以 AI 看到的不只是“点击了某个按钮”,还知道点击前页面长什么样、点击后页面发生了什么变化。

这就像给 AI 做了一次网页演示。你先做一遍,它再根据记录理解流程,之后尝试复现。

录制适合哪些场景

重复执行的后台操作很适合录制,比如固定流程的数据导出、内容审核、订单查询,或者每周都要做一次的网页整理工作。

录制完成后,可以把 trace 当成任务说明的一部分交给 AI。相比只说“帮我完成这个操作”,它多了真实的页面状态和动作顺序,出错时也更容易定位到底卡在了哪一步。

不过录制时要注意隐私。不要在银行、单点登录、密码管理器等页面录制,也不要把包含敏感信息的 trace 随便发给别人。--redact-values 可以把表单值标记为 [filled][empty],但涉及账号和密码的页面,最好还是直接避开。

我怎么看 BrowserSkill

以前让 AI 操作网页,通常要么依赖复杂的浏览器自动化脚本,要么只能把网页内容读出来,真正点击时还得自己补上。

BrowserSkill 把这件事拆得比较清楚:session 负责生命周期,Agent Window 负责隔离,observe 和 snapshot 负责理解页面,click、fill、select 负责执行动作,record 则负责把人的操作变成 AI 可以参考的流程。

尤其是录制功能,适合那些“我会做,但我懒得写教程”的任务。自己操作一遍,比对着网页截图解释半天省事多了。

如果你平时经常登录后台、查资料、填表格,或者有一堆重复网页流程,BrowserSkill 值得试试。先从一个不涉及隐私的小任务开始,跑通之后再慢慢把常用流程录下来。