用提示词玩转浏览器自动化:Kimi WebBridge三任务实践

在日常使用AI工具时,你是否遇到过这样的场景:想要让智能助手抓取特定网站的内容,但该网站需要登录才能查看完整信息,或者内容需要滚动加载,普通的联网搜索无法获取这些专属平台的数据?这时候,让AI直接控制浏览器就能解决这类问题。本文将详细介绍如何用AI驱动浏览器完成自动化任务,从原理到实操全流程拆解。
一、AI控制浏览器的三种实现路径
让AI指令驱动浏览器,市面上有不少技术方案,但从指令接入浏览器的方式来看,核心只有三条路径:
第一条是进程外调试协议,比如CDP这类方案。浏览器会开放一个供外部程序连接的调试端口,像Playwright、Selenium这类自动化框架都是基于这套逻辑实现的。这套方案的功能覆盖最全面,但网站很容易检测到自动化控制的痕迹,可能会拦截访问。
第二条是浏览器内扩展方案。将控制代码作为浏览器扩展运行,直接在页面内部进行操作,再通过本地服务将能力开放给外部AI工具。这套方案的最大优势是完全复用你当前浏览器的登录状态,和你手动操作的体验一致,网站无法区分操作来自真人还是AI。我们本次演示使用的Kimi WebBridge就属于这类方案,只需在本地运行后台服务、在Chrome中安装对应扩展,就能让AI直接调用打开页面、读取内容、填表点击、截图等一系列操作能力。
第三条是操作系统层模拟方案,通过在桌面端模拟鼠标键盘操作或者截屏识别来控制浏览器。这套方案不会留下任何协议层面的控制痕迹,但代价是每一步操作都需要截屏和识别,速度比前两种方案慢很多,而且窗口大小、页面缩放、元素遮挡等任何环境变化都会导致之前记录的点击坐标失效。
选择哪种路径,核心取决于你是否需要复用当前已登录的浏览器会话:如果需要保留登录状态,就选扩展方案;如果需要全新的干净会话,就选择其他路径。
目前主流的浏览器控制工具包括Browse Use和Kimi Web Bridge,根据实际使用体验,Browse Use的体验相对繁琐:一是每次连接都需要手动点击同意授权,无法自动完成连接;二是没有会话分组功能,每个标签页都是独立的,无法按任务隔离页面。而Kimi Web Bridge支持按任务创建会话组,可以将不同任务的页面完全隔离,使用体验更流畅。
准备工作很简单:只需在Chrome应用商店搜索安装Kimi WebBridge扩展,搭配Kimi Code、Claude Code这类命令行AI工具即可开始使用,直接复制对应的提示词发送给AI就能启动任务。
二、实操训练:从基础到综合的三个任务
控制浏览器的核心能力分为三类:读取页面内容、写入操作到页面、在真实站点完成综合任务。我们通过三个递进的任务来逐一练习,所有提示词都可以直接复制使用。
任务一:练习页面数据读取能力
这个任务的目标是让AI从页面中提取结构化数据,包括翻页这类连续操作。我们使用专门用于抓取练习的图书网站Books to Scrape作为测试站点。
需要发送给AI的提示词如下:
用 Kimi WebBridge 完成以下任务,session 名用 demo-books。 目标:打开 https://books.toscrape.com/,提取当前页全部图书的标题、价格、评分,然后翻到第二页再次提取。 验证标准: - 第一页返回 20 条,首项是 "A Light in the Attic"。 - 第二页返回 20 条,首项是 "In Her Wake"。 - 两页数据不能重复。 输出:两页的 JSON 数组,并给出条数和首项书名。
这里的session参数用于为本次浏览器会话命名,不同任务使用不同的会话名,可以实现多个任务同时运行且互不干扰。AI收到指令后会先打开首页,通过页面脚本一次性获取20本图书的信息,再翻到第二页获取另一批数据。需要注意的是,判断翻页是否成功不能只看指令返回结果,而是要通过返回的数据来验证页面是否真的切换到了第二页。
任务二:练习页面操作与结果验证
这个任务的目标是让AI完成页面填表、点击操作,并验证操作的实际结果。我们使用专门的测试登录站The Internet,该站点提供公开的测试账号。
需要发送给AI的提示词如下:
用 Kimi WebBridge 完成以下任务,session 名用 demo-login。 目标:在 https://the-internet.herokuapp.com/login 完成一次真实登录,用户名 tomsmith,密码 SuperSecretPassword!。 步骤建议: 1. navigate 到登录页。 2. 先 snapshot,找到用户名输入框、密码输入框、登录按钮的引用。 3. fill 用户名,fill 密码,click 登录按钮。 4. 等待 2 秒后再次 snapshot,检查跳转结果。 验证标准(必须全部满足): - 第二次 snapshot 的 url 包含 /secure。 - 页面文本里出现 "You logged into a secure area!"。 - 页面里能找到 Logout 链接。 click 返回 success 不算登录成功。
AI会先解析页面结构,定位到用户名框、密码框和登录按钮,完成信息填写和点击。这个任务的核心要点是:点击按钮返回的“成功”仅代表按钮被触发,不代表登录真正完成,因此必须通过多个维度的验证标准来确认结果,比如URL跳转、成功提示文本、退出按钮是否存在。
任务三:练习多站点综合采集能力
这个任务的目标是让AI同时处理两个不同的网站,创建独立会话,并应对页面结构与预期不符的情况。我们将采集GitHub Trending和Hacker News的前10条内容,合成一份技术日报。
需要发送给AI的提示词如下:
用 Kimi WebBridge 完成以下任务,GitHub 用 session demo-github,Hacker News 用 session demo-hn。 目标:分别打开 GitHub Trending 和 Hacker News,各提取前 10 条。 GitHub Trending:https://github.com/trending - 用 evaluate 从 article.Box-row 提取仓库名、链接、简介、语言、当日新增星标。 - 字段为空时先检查选择器是否匹配当前页面,不要把"选择器没匹配到"当成"数据不存在"。 Hacker News:https://news.ycombinator.com/ - 用 evaluate 从 tr.athing 提取排名、标题、链接、来源、分数、时间。 验证标准: - 两个站点各返回 10 条,每条有非空标题和链接。 输出:一份 Markdown 文档,分两节列出结果,给出采集时间。
提示词中的article.Box-row、tr.athing是页面元素的选择器,无需手动理解,直接复制即可。即使不写选择器,AI也会自动识别页面结构。在本次测试中,Hacker News的采集非常顺利,但GitHub的仓库简介第一次提取时返回了空值,按照提示词中的要求,AI没有直接判定“数据不存在”,而是重新检查了页面结构,最终发现简介实际位于p.col-9选择器下,修正后成功获取了所有数据。这说明在提示词中加入排错指引,可以让AI更好地应对真实网站的结构变化。
三、这套方法不绑定特定模型
很多用户会关心:这套流程是否只能用特定的AI模型?我们将上述三个任务的提示词分别发给了三款国产模型:豆包doubao-seed-evolving、阶跃Step Explore、Kimi K3,最终所有模型都顺利完成了任务,操作流程和演示一致。
实际使用中也存在一些细微差异:豆包和Kimi K3在拼接本地命令时遇到了引号冲突的语法错误,但两款模型都自动识别了问题并调整了写法完成修复;阶跃Step Explore全程没有告警,还主动提醒我们Hacker News的分数会随时间变化,如果验证标准中写死具体数值,即使任务成功也会被判定失败,给出了更完善的优化建议;Kimi K3有一次执行的命令出现了红色警告,但后续自动调整修正了问题。
四、核心要点总结
本文完整介绍了AI控制浏览器的全流程:
• 从路径选择来看,三种实现方式各有优劣,扩展方案最适合需要复用登录状态的场景;
• 控制浏览器的核心不是代码,而是提示词:清晰说明任务目标、明确验证标准、加入排错指引,就能让AI高效完成任务;
• 通过三个递进的实操任务,可以快速掌握读取、操作、综合采集三类核心能力,所有提示词都可以直接复用;
• 这套流程不绑定特定AI模型,国产大模型也能顺利完成所有任务,仅在细节处理上存在细微差异。
如果想要尝试,可以直接在Chrome应用商店搜索安装Kimi WebBridge,搭配任意支持命令行的AI工具即可开始使用。

