如果你做过浏览器自动化,大概都经历过这种场景:让 AI Agent 帮你查个东西,结果它要么弹个 "请扫码登录" 把你从正在写的代码里拽出来,要么干脆自己造一个隐身 Profile 然后又要你重新登一遍。更糟的是,Agent 一运行,你正打开的十几个 Tab 全被它关掉或挪走。
这其实就是过去三年浏览器自动化一直绕不开的痛点:登录态属于"我",但自动化工具每次都要"造一个我"。
2026 年 9 月,腾讯微信支付团队把内部孵化已久的 BrowserSkill 开源了。它做的事情很朴素——让 AI Agent 直接借你的浏览器干活。4,434⭐,9+ 主流 Agent 框架官方支持,OpenClaw 也在列。看起来是个小工具,但它指向了一个更深的范式:
Agent 不该和用户在同一个界面抢控制权,而是该在另一个窗口安静地把活干完。
下面我们把它拆开看——做了什么、怎么做到的、以及对你的 Agent 工具链意味着什么。

1. 一句话定位
BrowserSkill = 一个让 AI Agent 借用你真实浏览器(已登录态)干活的桥,由 bsk CLI + Chrome/Edge 扩展组成。它不是再造一个浏览器,而是给 AI Agent 颁发一张「临时借用证」:借你的 Tab、用完归还、你照常刷网页。
1.1 三秒理解 BrowserSkill 是什么
想象你雇了一个助理,你打开浏览器在工作,你想让他顺便帮你查个订单。他不另开一台新电脑(再造浏览器),而是站在你身后,借你打开的窗口瞄一眼(复用登录态),查完就走,不动你任何一个 Tab。
1.2 它不是什么
它不是 browser-use 的替代品(虽然能做类似的事),它更像是 browser-use 的"用户友好版"。如果你已经在用 Puppeteer 跑得很顺,没有"被登录态折磨"的痛点,可以先观望。
1.3 谁开发的
腾讯微信支付团队内部孵化项目,2026 年 9 月正式开源。开发者目标是解决内部"Agent 自动化时员工被反复踢出登录态"的抱怨——所以一上来就把"借浏览器"作为第一原则。
1.4 为什么叫 BrowserSkill
"Skill" 在 AI Agent 圈是一个特定术语,指"Agent 可以学会调用的一组能力"。BrowserSkill 这个名字意味着:它不是浏览器本身,而是"让 Agent 学会用浏览器"的能力包。
2. 核心能做什么
| 能力 | 对你意味着什么 |
|---|---|
| 真实登录态复用 | Agent 直接用你已登录的淘宝、Gmail、GitHub,不用每次给测试账号 |
| 不打断工作 | Agent 在独立的 "Agent Window" 跑,你照常用自己的浏览器 |
| 任意 Agent 通用 | 能调 shell 的 Agent 都能用(Cursor / Claude Code / Codex / OpenClaw…),不锁框架 |
| Human-in-the-loop | 遇到验证码、弹窗时,Agent 可主动请你介入,然后继续 |
| 多 Agent 共存 | 多个 Agent 同时各跑各的 session,互不打架 |
| 全页截图 | bsk screenshot –session <id> –full-page,长页面一图搞定 |
2.1 真实登录态复用:解决最大痛点
过去用 Puppeteer 跑自动化,每次都要在测试账号里手动登录一遍;或者导出 cookie 文件塞给脚本——前者费人,后者一旦 cookie 过期就崩。BrowserSkill 直接借你的浏览器:你已经登录的网站它自动就能用。
2.2 不打断工作:另一个被低估的价值
Agent 在独立的 Agent Window 跑,意味着你正在写的代码、正在看的文档、正在刷的 B 站,全都不受任何影响。对重度多任务用户来说,这点比"快"还重要。
2.3 Human-in-the-loop:让 Agent 学会"问"
当 Agent 遇到验证码、登录弹窗、二次确认对话框,它不会傻等超时,而是主动弹一个请求让你介入。你点完"是",它继续。这是过去自动化工具最缺的"礼貌"。
2.4 任意 Agent 通用:不锁框架
bsk CLI 是标准 shell 命令,理论上任何能调 shell 的 Agent 都能用。这意味着今天你换 Cursor,明天换 Claude Code,后天换 OpenClaw——BrowserSkill 都能继续用,不用换工具。
2.5 多 Agent 共存:互不打架
每个 Agent 拿到独立 session,等于独立 Profile:cookie、localStorage、登录态都不共享。这意味着你可以让一个 Agent 抓数据、另一个 Agent 填表,同一个浏览器里同时跑,谁也不影响谁。
2.6 全页截图:长页面一图搞定
bsk screenshot --session <id> --full-page 一条命令截下整个长页面(含折叠区域),不用自己拼图。对做内容审核、视觉回归的人特别有用。
3. 技术骨架:CLI + 扩展 + Session
3.1 两个运行时组件
3.1.1 bsk CLI/Daemon
本地命令行工具,负责 session 管理、进程控制。它是 Agent 与浏览器之间的"调度中心"。
3.1.2 Chrome/Edge 扩展
桥接浏览器与 daemon,把 Agent 的"借用请求"翻译成实际 Tab 操作。它不读你的任何数据,只在 Agent 显式调用时才动 Tab。
3.2 Session 模型(最值得借鉴的部分)
- 每个任务开独立 session(类似一个临时浏览器 profile)
- Agent 显式借用用户已有 Tab,用完归还——不是"接管"
- 沙箱隔离:Agent Window 与用户浏览器完全独立,cookie、localStorage 都不混
这个模型的核心哲学是:Agent 是客人,不是主人。它要什么,借一下;用完,还回去。
3.3 与传统浏览器自动化的本质区别
传统工具:Agent 启动一个全新的浏览器实例,自己掌控一切。BrowserSkill:Agent 借用用户已有的浏览器实例,全程受用户监管。前者更适合无人值守批处理,后者更适合"我看着它干活"的人机协作场景。
3.4 沙箱隔离的实现方式
Agent Window 与用户浏览器之间通过 Chrome 的 profile 隔离实现:两个 profile 完全独立,cookie / localStorage / 扩展都不共享。这意味着 Agent 跑任务时即使误操作也不会动到你的"真实"浏览器数据。
3.5 session 借还的生命周期
完整流程:Agent 调用 bsk session borrow --tab <id> → Chrome 扩展弹出确认(可关掉) → Agent 在独立窗口接管该 Tab → 任务结束 bsk session return → 用户 Tab 回到原位。中间每一步用户都能看到、能中止。
4. 5 分钟装起来
4.1 一键让 Agent 自我安装
直接把这一行发给 Agent(Cursor / Claude Code / OpenClaw / Codex 都行):
Set up browser-skill on this machine by following https://raw.githubusercontent.com/Tencent/BrowserSkill/main/AGENT_INSTALL.md
Agent 会自己下载、安装、注册——这就是"Agent-friendly 工具"该有的样子:一行指令,零人工。
4.2 手动安装
# macOS / Linux
curl -fsSL https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.sh | sh
# Windows
irm https://raw.githubusercontent.com/Tencent/BrowserSkill/main/install.ps1 | iex
# 验证
bsk --version
4.3 让 Agent harness 会用 bsk
bsk install-skill
# 或直接指定:
bsk install-skill --harness openclaw --json
4.4 安装完成的标志
装完之后,你应该能在终端跑通这三条:bsk --version(看版本)、bsk install-skill --harness openclaw --json(注册到 OpenClaw)、在 Chrome 扩展页看到 "BrowserSkill Bridge" 扩展已启用。三件事都 OK,就可以让 Agent 第一次借浏览器干活了。
5. 官方支持哪些 Agent
| Agent | 状态 |
|---|---|
| OpenClaw | ✅ 官方支持(有 SVG logo) |
| Cursor | ✅ 官方支持(有 SVG logo) |
| Claude Code | ✅ 官方支持(有 SVG logo) |
| Codex | ✅ 官方支持(有 SVG logo) |
| CodeBuddy | ✅ 官方支持 |
| WorkBuddy | ✅ 官方支持 |
| Pi | ✅ 官方支持 |
| Hermes Agent | ✅ 官方支持 |
| DeepSeek Harness | ✅ 官方支持 |
| 其他能调 shell 的 Agent | ✅ 通用支持(走 bsk CLI) |
OpenClaw 用户特别注意:BrowserSkill 在它的官方支持矩阵里排在第一行,logo 是单独画的,说明有专门维护的集成路径。
5.1 官方支持的判定标准
不是"能跑起来"就叫官方支持。BrowserSkill 的"官方支持"是指:在官方 README / 官网矩阵里单独列名、单独画 logo、有专门维护的 skill 文件或集成文档。这意味着你跑出 bug 提 issue,会有人接。
5.2 通用支持 vs 官方支持的区别
"通用支持"只意味着任何能调 shell 的 Agent 都能通过 bsk CLI 调用它——但没有专门的 skill 文件、没有 SVG logo、文档也只写一句"通过 CLI 集成"。能用,但自己要写适配层。
6. 横向对比:BrowserSkill vs browser-use / Puppeteer / Playwright
| 维度 | BrowserSkill | browser-use | puppeteer-agent | playwright-agent |
|---|---|---|---|---|
| 真实登录态复用 | ✅ 借你的浏览器 | ⚠️ 需另配 cookie | ❌ 单独登录 | ⚠️ 单独登录 |
| Agent 与用户隔离 | ✅ 独立 Agent Window | ✅ Puppeteer 隔离 | ⚠️ 同一浏览器 | ✅ Context 隔离 |
| 内置 Human-in-the-loop | ✅ | ❌ | ❌ | ⚠️ |
| 多 Agent 同时跑 | ✅ | ⚠️ | ❌ | ⚠️ |
| 支持 Agent 框架数 | 9+ | 1 | 1 | 1 |
一句话总结:其它三家是"给 Agent 造一个新浏览器",BrowserSkill 是"让 Agent 借你的浏览器"。后者对真人用户友好得多。
6.1 什么时候选 browser-use 而不是 BrowserSkill
如果你跑的是无人值守的 CI 流水线、不需要"借用真实登录态"、只用一些公开数据采集,那 browser-use 反而更轻——它没有"借 Tab"的开销,直接 headless 跑就行。
6.2 什么时候 Playwright 比 Puppeteer 更合适
Playwright 的 Context 隔离比 Puppeteer 更彻底,多浏览器(Chromium / Firefox / WebKit)支持更好。如果你的脚本要跨浏览器回归测试,Playwright 是更稳的选择。
7. 谁该装、谁可以观望
7.1 强烈推荐装
- 你已经在用 OpenClaw / Cursor / Claude Code 写代码,偶尔想让 Agent 帮你查文档、下数据
- 你做电商或运营,需要 Agent 帮忙监控价格、采集公开信息
- 你团队里有多个 Agent(自动化测试 + 数据抓取 + 客服)想并行跑
7.2 可以先观望
- 你已经在用 browser-use 的 Puppeteer 方案跑得很顺,没有"被登录态折磨"的痛点
- 你只在自己一台机器上跑单 Agent
7.3 部署前提
- macOS / Linux / Windows + Chrome 或 Edge
- Agent 需能持久化 daemon(需配置
BSK_HOME+BSK_AUTO_START=0)
8. 对 Agent 架构师的三点启示
8.1 "借用"比"接管"更友好
BrowserSkill 的 session 模型证明:让 Agent 当客人、把控制权留给用户,是浏览器自动化真正能落地的关键。过去三年大家都默认 Agent 必须"接管"浏览器,BrowserSkill 用"借"的思路打开了新解法。
8.2 一行自安装是 Agent 工具的新基准
Set up browser-skill on this machine by following ... 这种"让 Agent 自我部署"的指令,会取代一长串 README 步骤。Agent 工具的设计目标,应该是让 Agent 自己看得懂安装说明。
8.3 官方支持矩阵是生态护城河
9+ Agent 框架官方支持不是数字游戏,意味着任何写 Agent 工具的人都该问:"我的工具,能不能让 10 个主流 Agent 不用改代码就用上?"——这才是 Agent 时代的"跨平台"。
9. 一周落地路线(给想动手的人)
- Day 1:装
bskCLI + Chrome 扩展,验证bsk --version - Day 1:跑
bsk install-skill --harness openclaw,让 OpenClaw 学会用 bsk - Day 2:把 OpenClaw 里现有的 browser-use 任务切到 BrowserSkill,对比登录态获取速度
- Day 3:跑两个 Agent 同事——一个抓数据、一个填表——看 session 隔离是否真互不打架
- Day 5:写一篇你团队的 BrowserSkill + OpenClaw 集成笔记,反哺社区
9.1 Day 1 任务清单(5 分钟搞定)
- 跑
curl -fsSL ... install.sh | sh - Chrome 装 BrowserSkill Bridge 扩展
bsk install-skill --harness openclaw --jsonbsk --version看到版本号 → 收工
9.2 Day 2 切换要点
不要一刀切——保留 browser-use 做无人值守任务(数据采集),把"需要登录态"的任务(商品查询、价格监控)切到 BrowserSkill。混跑一周,看真实效果再决定是否全面迁移。
9.3 Day 3 多 Agent 并行验证
开两个 terminal:一个跑 bsk session a 让 Agent A 抓天猫商品,另一个跑 bsk session b 让 Agent B 填某后台表单。看两个 session 是否真的互不干扰(cookie、Tab 状态、localStorage)。
9.4 Day 5 文档与社区反哺
把你团队的踩坑点(OpenClaw 集成、BaaS cookie 过期处理、agent window 关闭后 session 丢失等)写成一篇博客或一篇 README 补丁,提 PR 给 Tencent/BrowserSkill。这是 Agent 时代"用了就反哺"的标准动作。
写在最后
BrowserSkill 不是要"颠覆"浏览器自动化,它只是把一件被大家默认忍受了很久的事——"Agent 干活时必须抢你的浏览器"——重新做了一遍。
它的价值不在某个炫酷功能,而在整套交互哲学:Agent 是客人,借完就还;用户是主人,干活归干活,Tab 照常开。这套哲学,对所有做 Agent 工具的人来说,都值得借鉴。
如果你正在用 OpenClaw,今天就可以花 5 分钟装一下——大概率你不会想换回去。