AI代理上网还得靠它,WebCLI才是正解
当你的AI助手变成"睁眼瞎"
你有没有遇到过这种情况:你的代码助手写得一手好Python,代码架构也门儿清,按照你的规范老老实实干活。结果你让它去后台管理系统看一眼新用户注册情况是否正常——
一片沉默。
它能分析问题,但看不到后台界面,点不了按钮,验证不了登录流程。整个真实存在的网页世界——各种仪表盘、后台管理、登录系统、UI三天两头改版的页面——对它来说就像隔着一层玻璃,看得见摸不着。
WebCLI 就是要解决这个问题。说实话,这个问题一直在悄悄拖AI助手的后腿,只是没多少人愿意承认。
助手真正需要的 vs 实际给它的
说句不好听的:现在大多数所谓的"浏览器自动化",其实就是给AI扔一张截图,让它猜猜页面上在发生什么。这就好比你怀疑发动机有问题,结果只给你看一张照片——画面是挺好看,但发动机到底怎么了?不知道。
你的助手不需要图片。它需要的是:
- 页面的实时状态 —— 上面有哪些元素?属性是什么?有什么可以操作的?
- 带编号的操作选项 —— 目前有1到7个动作可选,挑一个,执行,看看结果。
- 靠谱的异常处理 —— 页面没按预期加载?没关系,告诉你出了什么状况,怎么补救。
- 需要人类介入时的提醒 —— 遇到验证码?双重验证?助手不该崩溃,而是应该知道什么时候该喊人。
WebCLI 就是来解决这个的。你可以把它想象成:给AI助手装上一套完整的仪表盘和监控设备,而不是让它从一个钥匙孔里往外看。
设计理念:文本化的助手界面
WebCLI 背后的核心思路其实很简单:网页本来就是给人看的。按钮要好看,鼠标悬停要有动画效果,内容要动态加载,页面要无限滚动……这些设计全是服务人类的。
那AI助手呢?给它截图?给它一个选择器字符串,等哪天前端程序员加了个 data-testid,选择器就废了?
WebCLI 把这套逻辑整个倒过来了。它不是逼着助手去硬啃面向人类的界面,而是把真实的网页翻译成助手能直接理解的语言:
页面状态:
- 标题:"用户后台 | 示例公司"
- 表单字段:[用户名, 密码, 记住我]
- 可用操作:[0: 登录, 1: 忘记密码, 2: 注册账号]
- 阻塞项:无
- 操作记录:12条
这才是真正的网页,转化成结构化数据。你的助手可以直接分析这些数据,用 jq 过滤,做判断的时候依据的是真实状态,而不是瞎猜。
一条命令,所有助手都能上手
WebCLI 最聪明的地方是 SKILL.md 这套玩法。它不是什么专有集成方案,只做一个标准化的技能定义。装一次,Claude Code、Cursor、Copilot、 Gemini CLI 等等各种代码助手,马上就知道怎么操作浏览器了。
这个技能文件给助手们定了几条铁律:
- 先观察再行动 —— 操作之前先看看页面状态
- 用编号来定位 —— 元素按编号来引用,别用那些一碰就碎的选择器
- 优先要JSON格式 —— 结构化数据比截图靠谱
- 遇到障碍就暂停 —— 识别出需要人工处理的情况
- 记录全程日志 —— 每个动作都留下记录
这不是让你去学什么新框架。就是给你的现有助手加一个开箱即用的浏览器操作能力。
助手的循环:一步一步来,别想一口吃成胖子
很多人搞自动化会犯同一个错误:想把整个浏览器操作流程塞进一条命令。"去后台,登录,点击第三个按钮,提取表格数据,然后发邮件给我。"
这不是自动化,这是叠叠乐。
WebCLI 最好的用法是让它跑一个实时循环:
观察 → 选择下一步 → 执行 → 再观察 → 出问题就恢复 → 需要人工就暂停 → 继续
每一步都是独立的,每一步都可以优雅地失败,每一步都会更新日志。你的助手不是在跑宏——它是真正在驾驶浏览器,清清楚楚知道自己在干什么。
隐私:你的浏览器还是你的
现在的AI动不动就"云端处理",WebCLI 反其道而行之。它在本地跑。浏览器状态不离开你的电脑。只有 outbound 的连接是用来验证授权的——你的浏览习惯、Cookie、截图、工作流数据,统统不会传出去。
这对企业用户很重要。对处理敏感账号密码的开发者很重要。对任何一个不想让自己的内部工具变成别人训练数据的普通人,也很重要。
不是替代你,而是给你添把手
WebCLI 的目标从来不是取代人的判断。它的 slogan "Technology for agency"——"让技术成为你的代理人"——意思不是机器来替代你,而是给你添一双能真正在网页上干活的手,让你腾出精力做那些真正需要动脑子的事情。
助手拿到的是:页面状态、可执行操作、阻塞提示、人工介入时机、操作日志。
你保留的是:目标意图、最终授权、拍板权。分工明确,效率翻倍。
你可能需要关心这个
如果你在用AI助手做任何需要跟真实网页打交道的事——后台管理、内部系统、工作流自动化、测试脚本——WebCLI 值得你认真研究一下。
浏览器不只是给人用的。配上正确的接口,你的助手也能真正"操作"网页,而不只是想象它长什么样。
别什么事都自己干了。给你的助手配上一套趁手的工具,让它真正接管那些机械重复的操作。
WebCLI,也许就是你AI助手架构里缺的那块拼图。