
BrowserSkill上手:让AI接入浏览器,还能录制动作教它学习
我一直觉得,让 AI 只会聊天有点浪费。很多事情明明已经打开网页了,最后一步却还得我自己点:搜索、填写、切换页面、提交。
BrowserSkill 做的事情很直接,让 AI 真正接入浏览器。
它不是给浏览器套一个聊天窗口,而是通过 bsk CLI 和浏览器扩展建立连接,再让 AI 去观察页面、理解页面上的控件,然后执行点击、输入和选择等动作。
BrowserSkill 是怎么工作的
BrowserSkill 需要两个东西:一个是安装在电脑上的 bsk 命令行工具,另一个是加载到 Chromium 中的 browser-skill 扩展。扩展连接成功后,浏览器里会显示绿色状态。


AI 发起任务时,BrowserSkill 会打开一个独立的 Agent Window。这个窗口和用户正在使用的浏览器窗口分开,AI 默认只操作自己的标签页。需要操作用户现有页面时,也可以先把指定标签页借用进来,完成后再归还。
这个隔离设计我比较喜欢。AI 要跑网页任务,就让它在自己的窗口里跑,不会突然把我正在看的网页刷新掉。
先观察,再操作
BrowserSkill 的基本工作流是:
1 | bsk session start |
observe 用来获取页面的语义信息,能看到页面文字、按钮、输入框以及可交互控件。snapshot 则是更严格的无障碍树快照,适合在页面结构比较复杂时使用。
AI 先观察页面,再根据按钮名称或输入框的作用执行操作。网页改版后,元素位置可能变了,但只要按钮文字和页面结构没有完全改变,AI 仍然有机会找到正确的目标。
当然,它也不是开了挂。验证码、登录、短信验证和支付确认这类步骤,还是应该停下来交给人处理。任务完成后要及时结束 session,不要让 AI 长时间接管浏览器。
最有意思的功能:录制动作教 AI 学习
BrowserSkill 里我觉得最有意思的是 bsk record。


有些网页操作很难用语言描述。比如先打开某个后台,进入指定菜单,筛选日期,再点击导出。你可以写一大段说明,但 AI 还是可能漏掉中间某一步。
这时候可以直接录制。
指令可以让ai来操作。你填写完点击复制即可。

然后像平时一样操作网页,完成后点击录制面板里的 Finish。BrowserSkill 会生成一个 trace bundle,里面至少包含 trace.json,新版本还会保存 states/ 目录。
trace.json 里有动作链,每一步还会关联操作前后的页面状态。states/ 里保存页面观察结果,所以 AI 看到的不只是“点击了某个按钮”,还知道点击前页面长什么样、点击后页面发生了什么变化。
这就像给 AI 做了一次网页演示。你先做一遍,它再根据记录理解流程,之后尝试复现。
录制适合哪些场景
重复执行的后台操作很适合录制,比如固定流程的数据导出、内容审核、订单查询,或者每周都要做一次的网页整理工作。
录制完成后,可以把 trace 当成任务说明的一部分交给 AI。相比只说“帮我完成这个操作”,它多了真实的页面状态和动作顺序,出错时也更容易定位到底卡在了哪一步。
不过录制时要注意隐私。不要在银行、单点登录、密码管理器等页面录制,也不要把包含敏感信息的 trace 随便发给别人。--redact-values 可以把表单值标记为 [filled] 或 [empty],但涉及账号和密码的页面,最好还是直接避开。
我怎么看 BrowserSkill
以前让 AI 操作网页,通常要么依赖复杂的浏览器自动化脚本,要么只能把网页内容读出来,真正点击时还得自己补上。
BrowserSkill 把这件事拆得比较清楚:session 负责生命周期,Agent Window 负责隔离,observe 和 snapshot 负责理解页面,click、fill、select 负责执行动作,record 则负责把人的操作变成 AI 可以参考的流程。
尤其是录制功能,适合那些“我会做,但我懒得写教程”的任务。自己操作一遍,比对着网页截图解释半天省事多了。
如果你平时经常登录后台、查资料、填表格,或者有一堆重复网页流程,BrowserSkill 值得试试。先从一个不涉及隐私的小任务开始,跑通之后再慢慢把常用流程录下来。






































