agentbrowse:AI编程助手终于有了趁手的终端界面
agentbrowse:让 AI 也能优雅地"上网冲浪"
说实话,AI 编程助手处理命令行和代码文件时确实溜得飞起。但一让它们去操作网页界面?那是真的拉胯。
这就是 agentbrowse 要解决的问题。它是一个 CLI 工具,把 Playwright 包了一层,做成一个对 AI 友好的简单接口。支持 Claude Code、Codex、Cursor 这些主流编程助手。
AI 和网页界面的"代沟"
传统的浏览器自动化都是给人设计的。人能搞定 CAPTCHA、能凭直觉看懂页面布局、能精准点中那个小按钮。AI 呢?它擅长执行精确指令,但面对视觉界面的模糊性就歇菜了。
agentbrowse 把这个关系给反转了。AI 不再需要硬刚浏览器,而是拿到一套干净的 API:打开 URL、把页面转成 markdown 读取、按文字或序号点击、填表单——全通过终端命令搞定,返回的都是结构化数据。
分分钟上手
安装简单到离谱:
npm install -g agentbrowse
npx playwright install chromium
完事。首次运行会自动下载 Chromium,之后就能开干了。
核心用法也特别简洁:
agentbrowse open <url>— 打开网页agentbrowse read— 把当前页面转成干净的 markdownagentbrowse links— 显示带编号的可点击链接agentbrowse click "Sign up"— 按文字或链接编号点击agentbrowse read --json— 输出程序可解析的 JSON 格式
持久会话:这才是精髓
agentbrowse 真正好用的地方在于它的持久会话机制。一个后台浏览器进程持续运行,保持页面状态不丢。这意味着你可以打开网站、完成登录、浏览到某个页面,然后把状态交给 AI 助手——全程不需要反复重建状态。
每个会话都有独立 ID,带自己的 cookie 和认证状态。login 命令甚至会打开真实的浏览器窗口让你手动处理 MFA 和 CAPTCHA,然后把认证好的会话保存下来供无头模式复用。
让 AI 自动掌握这个技能
这步就很巧妙了。你可以把 agentbrowse 安装成 AI 的一个"技能":
npx agentbrowse skill --global
它会自动生成对应助手的配置文件——Claude Code 用 SKILL.md,Cursor 用 .cursor/rules,Codex 用 AGENTS.md。以后 AI 遇到需要操作网页的场景,就会自动调用浏览器自动化。
不用再写一大段 prompt 教它怎么用浏览器。这能力就在那儿,随用随取。
给机器看的结构化输出
每个命令都支持 --json 输出格式,错误信息也有统一规范,退出码分别是:2 表示用法错误,3 表示导航失败,4 表示找不到目标,5 表示守护进程问题。这些设计让 agentbrowse 特别适合 CI/CD 流程和自动化脚本。
网站清单:针对特定站点的超能力
遇到复杂的或者常用的网站,还可以定义一个网站清单文件,暴露一些命名好的高级命令:
agentbrowse --site ./github.agent.json create-issue "登录流程有 bug"
清单文件里可以声明页面路径、选择器、命令序列,还支持变量插值——本质上就是为特定网站定制了一套专属"技能"。
更大的图景
agentbrowse 代表了一种思路转变:与其指望 AI 的视觉模型去模拟人操作浏览器,不如给 AI 配备为它的长处量身定制的工具——结构化命令、可解析输出、持久状态。
对于正在构建 AI 驱动工作流的开发者来说,这是个填补真实空白的实用工具。对于想探索 AI 辅助开发的人,这是一个窗口——让我们看到 AI 与工具的交互方式正在进化:从为人类设计的视觉界面,走向为机器设计的程序化接口。
不管你是想自动化网页测试、构建 AI 工作流,还是单纯好奇 AI 工具交互的未来,agentbrowse 都值得试试。它是 MIT 协议开源、活跃维护、纯本地运行——不依赖任何云服务或外部 API。
终端回来了,现在连 AI 也能用它了。