Browser-Use 入门指南:让 AI 替你完成重复网页操作的教程
【免费下载链接】browser-use🌐 Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use
Browser-Use 是一个开源的 AI 浏览器自动化框架:你用一句自然语言描述任务,它就在真实浏览器里替你打开页面、点击、填表、下载。今天你写下的那句任务描述,就是明天可以无人值守跑起来的脚本。
它替你省掉哪几件重复劳动
先看三个每天都在消耗时间的场景:
- 每周一下午,打开 4 个竞品官网,逐个记下旗舰款价格,誊进 Excel,再算环比;
- 每月发薪日前,从 3 个后台系统各导一份报表,逐个改名、归档;
- 新员工入职,几十份结构相同的申请单,只改名字和部门就重复填一遍。
这些事单件都不难,难在多、碎、重复,还容易在第三次复制粘贴时手滑出错。
定位一句话:Browser-Use 让你用中文或英文写一句话,它负责把这句话变成浏览器里真实发生的点击和输入。
可信度方面的几个事实,均来自 README.md:
- MIT 协议开源,框架本身免费;
- 官方基准 BU Bench V1 在 100 个真实浏览器任务上测得 85.0% 的成功率(用自家托管模型,见下文图表);
- 在 Odysseys 公开榜(200 个长程网页任务)上以 87.4% 的平均分排名第一,跑赢 OpenAI、Anthropic、Google、Microsoft 的 computer-use agent;
- 仓库 star 数已达 6.9 万,意味着这套方案被大量真实场景验证过。
5 分钟装好环境并跑通第一个任务
环境要求:Python 3.11 及以上;本机装有 Chrome 或 Chromium。
安装一共 3 条命令,其中 clone 是可选的——克隆仓库主要是为了浏览examples/里的现成脚本:
# 克隆仓库(含 examples/ 示例脚本,方便对照抄改) git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use # 安装框架本体,Python 3.11+ pip install browser-use然后把大模型密钥写进项目根目录的.env文件,例如BROWSER_USE_API_KEY=你的密钥,也可以换成OPENAI_API_KEY、GOOGLE_API_KEY这类自带密钥的方式。
最小可运行示例,任务改成"去 PyPI 查 requests 库的版本":
import asyncio from browser_use import Agent, ChatBrowserUse # Agent 是大脑+手,ChatBrowserUse 接大模型 async def main(): agent = Agent( task="打开 PyPI 的 requests 库页面,记录最近 3 个版本号和发布日期", llm=ChatBrowserUse(model="openai/gpt-5.5"), # 也可换其他模型,见后文 ) history = await agent.run() # 返回完整执行历史,可用于事后审计 print(history) asyncio.run(main())运行后你会看到:真实浏览器窗口自动打开,导航到页面,逐行读出数字,最后把执行历史打印出来。整个过程 1-2 分钟,比手动查还快。
3 个可以直接复制改用的真实用例
它吃的是任务描述,不是代码。下面三件,输入和预期输出都写清楚了,改个对象名就能用。
用例 1:依赖版本巡检(对应 examples/ 里的提取类脚本)
- 输入:打开 PyPI 上 requests 和 httpx 两个库的下载页,导出 CSV,列是"库名、最新版本、发布日期"
- 预期输出:工作目录下生成一个 2 行 3 列的 CSV 文件,文件名带当天日期
用例 2:批量会议预订(对应表单填写类场景)
- 输入:登录公司内部会议系统,为 8 月 25 日至 29 日的 15:00-16:00 各订一间 8 人会议室,标题分别写"周会",全部订完后截图留档
- 预期输出:日历上出现 5 条预订记录 + 一张截图文件
用例 3:竞品价格周报(对应监控巡检类场景)
- 输入:访问 3 个竞品官网,记录旗舰款价格写入 CSV,任何一家价格较上次记录变动超过 5% 时,在该行加"⚠变动"标记
- 预期输出:按日期追加的 CSV,变动行带标记;配合系统定时任务,每周自动跑一次
再重一点的活也有现成演示:仓库里有一个广告生成应用,AI 先抓官网信息,再产出广告图和落地页,成品长这样:
完整代码在 examples/apps/ad-use/ 目录,改个目标网站地址就能复用。
模型怎么选:先看官方基准数据再定
同一个任务换不同模型,成功率差距接近 3 倍。下图是官方 BU Bench V1 基准(100 个真实浏览器任务)的结果:
数据直接读图即可,选型各给一句理由:
- 性能优先:用托管模型(图里橙色两根,85.0% / 78.0%),且官方称其完成任务的速度比其他模型快 3-5 倍;
- 成本优先:gpt-5.5(66.0%)或 gemini-3.5-flash(65.0%)这类通用模型,差距不大时省下 API 费用;
- 安全优先:用 examples/models/ollama.py 的方式接本地 Ollama,数据不出内网,适合敏感业务,代价是成功率会更低。
切换模型只改一行代码:ChatBrowserUse支持带厂商前缀的模型 id,一个BROWSER_USE_API_KEY就能同时访问多家模型;也可以换成ChatOpenAI、ChatAnthropic等各自的客户端。
进阶:加自定义工具和调浏览器行为
加自定义工具:给 Agent 注册一个普通 Python 函数,AI 会在需要时主动调用它,而不是自己心算:
from browser_use import Agent, Tools tools = Tools() @tools.action(description="把字符串按逗号拆成列表") # description 决定 AI 何时调用 def split_csv(s: str) -> list[str]: return [x.strip() for x in s.split(",")] agent = Agent(task="解析表格第一列并去重", llm=your_llm, tools=tools)调浏览器行为:所有配置集中在 browser_use/browser/profile.py 的BrowserProfile里,常用项有:
allowed_domains/prohibited_domains:域名白名单,收窄 Agent 能访问的范围;headless:无窗口模式,适合服务器定时跑;user_data_dir:复用你已有的 Chrome 配置和登录态;- 下载路径、代理、页面加载超时等也都能在这里调。
挂回调:框架内置事件系统(实现在 browser_use/browser/ 下的各 watchdog 模块),页面加载、下载完成、弹窗出现等时机都可以挂自己的逻辑。
避坑清单:稳定性、安全、性能
- 稳定性:
- 任务描述写清可验证的完成标准,"导出 CSV"不如"导出 CSV 且列名固定为 a/b/c"稳;
- 给
Agent(max_steps=...)设步数上限兜底防死循环,主模型挂掉时配一个fallback_llm顶上,而不是让整个任务失败(重试逻辑在 browser_use/agent/service.py 里可以看到)。
- 安全:
- API 密钥只放
.env,不写进代码; - 需要登录的站点,优先用 examples/browser/save_cookies.py 保存登录状态或复用真实浏览器配置,别把明文密码写进任务描述传给模型。
- API 密钥只放
- 性能:
- 并发 Agent 先跑 1-2 个,每个都会占一份浏览器内存,跑顺了再加;
- 长任务用
headless=True,大站点页面加载慢时可考虑禁用图片加载提速。
高频问题快答
它免费吗?框架本身 MIT 开源免费,你只为所用大模型的 API 调用付费;接本地 Ollama 连这部分也省了。
不会写代码能用吗?能。最小示例十几行,照抄后只改task=里的任务描述即可;复杂场景去 examples/ 挑现成脚本改。
需要登录的网站怎么办?支持保存 Cookie 与会话状态,也支持复用你已登录的 Chrome 配置目录,首次登录后状态会保留。
会被网站检测出来吗?它基于真实 Chromium 内核操作,带随机延迟降低明显机器的特征;高安全级别站点建议先小规模试跑,别一上来就放量。
支持中文网站吗?支持,中英文页面都能处理,任务描述直接用中文写即可。
Python 版本有要求吗?3.11 及以上,装之前用python --version确认一下。
现在就能做的三步
- 今晚(10 分钟):按上文 3 条命令装好环境,跑通查 PyPI 版本的最小任务;
- 明天(30 分钟):在 examples/ 目录里挑一个最像你日常工作的脚本,改掉任务描述跑起来;
- 本周内:给高频任务加一个自定义工具,或者把模型换成 Ollama 本地模型。
常用资源都在这:
- 完整文档入口:README.md
- 各场景示例:examples/
- Agent 参数速查:skills/open-source/references/agent.md
- 边界情况测试(可当行为参考):tests/
把重复的网页操作交给 Browser-Use,把整块时间留给自己——打开终端,从今晚的第一条命令开始。
【免费下载链接】browser-use🌐 Make websites accessible for AI agents. Automate tasks online with ease.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考