Browser-Use 入门指南:让 AI 替你完成重复网页操作的教程
2026/8/29 22:56:25 网站建设 项目流程

Browser-Use 入门指南:让 AI 替你完成重复网页操作的教程

【免费下载链接】browser-use🌐 Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use

Browser-Use 是一个开源的 AI 浏览器自动化框架:你用一句自然语言描述任务,它就在真实浏览器里替你打开页面、点击、填表、下载。今天你写下的那句任务描述,就是明天可以无人值守跑起来的脚本。

它替你省掉哪几件重复劳动

先看三个每天都在消耗时间的场景:

  • 每周一下午,打开 4 个竞品官网,逐个记下旗舰款价格,誊进 Excel,再算环比;
  • 每月发薪日前,从 3 个后台系统各导一份报表,逐个改名、归档;
  • 新员工入职,几十份结构相同的申请单,只改名字和部门就重复填一遍。

这些事单件都不难,难在多、碎、重复,还容易在第三次复制粘贴时手滑出错。

定位一句话:Browser-Use 让你用中文或英文写一句话,它负责把这句话变成浏览器里真实发生的点击和输入。

可信度方面的几个事实,均来自 README.md:

  • MIT 协议开源,框架本身免费;
  • 官方基准 BU Bench V1 在 100 个真实浏览器任务上测得 85.0% 的成功率(用自家托管模型,见下文图表);
  • 在 Odysseys 公开榜(200 个长程网页任务)上以 87.4% 的平均分排名第一,跑赢 OpenAI、Anthropic、Google、Microsoft 的 computer-use agent;
  • 仓库 star 数已达 6.9 万,意味着这套方案被大量真实场景验证过。

5 分钟装好环境并跑通第一个任务

环境要求:Python 3.11 及以上;本机装有 Chrome 或 Chromium。

安装一共 3 条命令,其中 clone 是可选的——克隆仓库主要是为了浏览examples/里的现成脚本:

# 克隆仓库(含 examples/ 示例脚本,方便对照抄改) git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use # 安装框架本体,Python 3.11+ pip install browser-use

然后把大模型密钥写进项目根目录的.env文件,例如BROWSER_USE_API_KEY=你的密钥,也可以换成OPENAI_API_KEYGOOGLE_API_KEY这类自带密钥的方式。

最小可运行示例,任务改成"去 PyPI 查 requests 库的版本":

import asyncio from browser_use import Agent, ChatBrowserUse # Agent 是大脑+手,ChatBrowserUse 接大模型 async def main(): agent = Agent( task="打开 PyPI 的 requests 库页面,记录最近 3 个版本号和发布日期", llm=ChatBrowserUse(model="openai/gpt-5.5"), # 也可换其他模型,见后文 ) history = await agent.run() # 返回完整执行历史,可用于事后审计 print(history) asyncio.run(main())

运行后你会看到:真实浏览器窗口自动打开,导航到页面,逐行读出数字,最后把执行历史打印出来。整个过程 1-2 分钟,比手动查还快。

3 个可以直接复制改用的真实用例

它吃的是任务描述,不是代码。下面三件,输入和预期输出都写清楚了,改个对象名就能用。

用例 1:依赖版本巡检(对应 examples/ 里的提取类脚本)

  • 输入:打开 PyPI 上 requests 和 httpx 两个库的下载页,导出 CSV,列是"库名、最新版本、发布日期"
  • 预期输出:工作目录下生成一个 2 行 3 列的 CSV 文件,文件名带当天日期

用例 2:批量会议预订(对应表单填写类场景)

  • 输入:登录公司内部会议系统,为 8 月 25 日至 29 日的 15:00-16:00 各订一间 8 人会议室,标题分别写"周会",全部订完后截图留档
  • 预期输出:日历上出现 5 条预订记录 + 一张截图文件

用例 3:竞品价格周报(对应监控巡检类场景)

  • 输入:访问 3 个竞品官网,记录旗舰款价格写入 CSV,任何一家价格较上次记录变动超过 5% 时,在该行加"⚠变动"标记
  • 预期输出:按日期追加的 CSV,变动行带标记;配合系统定时任务,每周自动跑一次

再重一点的活也有现成演示:仓库里有一个广告生成应用,AI 先抓官网信息,再产出广告图和落地页,成品长这样:

完整代码在 examples/apps/ad-use/ 目录,改个目标网站地址就能复用。

模型怎么选:先看官方基准数据再定

同一个任务换不同模型,成功率差距接近 3 倍。下图是官方 BU Bench V1 基准(100 个真实浏览器任务)的结果:

数据直接读图即可,选型各给一句理由:

  • 性能优先:用托管模型(图里橙色两根,85.0% / 78.0%),且官方称其完成任务的速度比其他模型快 3-5 倍;
  • 成本优先:gpt-5.5(66.0%)或 gemini-3.5-flash(65.0%)这类通用模型,差距不大时省下 API 费用;
  • 安全优先:用 examples/models/ollama.py 的方式接本地 Ollama,数据不出内网,适合敏感业务,代价是成功率会更低。

切换模型只改一行代码:ChatBrowserUse支持带厂商前缀的模型 id,一个BROWSER_USE_API_KEY就能同时访问多家模型;也可以换成ChatOpenAIChatAnthropic等各自的客户端。

进阶:加自定义工具和调浏览器行为

加自定义工具:给 Agent 注册一个普通 Python 函数,AI 会在需要时主动调用它,而不是自己心算:

from browser_use import Agent, Tools tools = Tools() @tools.action(description="把字符串按逗号拆成列表") # description 决定 AI 何时调用 def split_csv(s: str) -> list[str]: return [x.strip() for x in s.split(",")] agent = Agent(task="解析表格第一列并去重", llm=your_llm, tools=tools)

调浏览器行为:所有配置集中在 browser_use/browser/profile.py 的BrowserProfile里,常用项有:

  • allowed_domains/prohibited_domains:域名白名单,收窄 Agent 能访问的范围;
  • headless:无窗口模式,适合服务器定时跑;
  • user_data_dir:复用你已有的 Chrome 配置和登录态;
  • 下载路径、代理、页面加载超时等也都能在这里调。

挂回调:框架内置事件系统(实现在 browser_use/browser/ 下的各 watchdog 模块),页面加载、下载完成、弹窗出现等时机都可以挂自己的逻辑。

避坑清单:稳定性、安全、性能

  • 稳定性
    • 任务描述写清可验证的完成标准,"导出 CSV"不如"导出 CSV 且列名固定为 a/b/c"稳;
    • Agent(max_steps=...)设步数上限兜底防死循环,主模型挂掉时配一个fallback_llm顶上,而不是让整个任务失败(重试逻辑在 browser_use/agent/service.py 里可以看到)。
  • 安全
    • API 密钥只放.env,不写进代码;
    • 需要登录的站点,优先用 examples/browser/save_cookies.py 保存登录状态或复用真实浏览器配置,别把明文密码写进任务描述传给模型。
  • 性能
    • 并发 Agent 先跑 1-2 个,每个都会占一份浏览器内存,跑顺了再加;
    • 长任务用headless=True,大站点页面加载慢时可考虑禁用图片加载提速。

高频问题快答

它免费吗?框架本身 MIT 开源免费,你只为所用大模型的 API 调用付费;接本地 Ollama 连这部分也省了。

不会写代码能用吗?能。最小示例十几行,照抄后只改task=里的任务描述即可;复杂场景去 examples/ 挑现成脚本改。

需要登录的网站怎么办?支持保存 Cookie 与会话状态,也支持复用你已登录的 Chrome 配置目录,首次登录后状态会保留。

会被网站检测出来吗?它基于真实 Chromium 内核操作,带随机延迟降低明显机器的特征;高安全级别站点建议先小规模试跑,别一上来就放量。

支持中文网站吗?支持,中英文页面都能处理,任务描述直接用中文写即可。

Python 版本有要求吗?3.11 及以上,装之前用python --version确认一下。

现在就能做的三步

  1. 今晚(10 分钟):按上文 3 条命令装好环境,跑通查 PyPI 版本的最小任务;
  2. 明天(30 分钟):在 examples/ 目录里挑一个最像你日常工作的脚本,改掉任务描述跑起来;
  3. 本周内:给高频任务加一个自定义工具,或者把模型换成 Ollama 本地模型。

常用资源都在这:

  • 完整文档入口:README.md
  • 各场景示例:examples/
  • Agent 参数速查:skills/open-source/references/agent.md
  • 边界情况测试(可当行为参考):tests/

把重复的网页操作交给 Browser-Use,把整块时间留给自己——打开终端,从今晚的第一条命令开始。

【免费下载链接】browser-use🌐 Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询