browser-use 入门完整指南:AI 自动下载网页文件,一句话跑通批量归档

发布时间:2026/9/24 14:23:52
browser-use 入门完整指南:AI 自动下载网页文件,一句话跑通批量归档 browser-use 入门完整指南AI 自动下载网页文件一句话跑通批量归档【免费下载链接】browser-useAgents that use the browser.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use月底结算120 份物流 PDF 要逐份点开、右键、另存为光下载就耗掉你半天。browser-use 是让 AI 直接操作浏览器、自动完成浏览→下载→归档全链路的开源框架你用一句话描述任务它自己打开网页、找到下载链接、保存文件全程不用碰鼠标。这篇 browser-use 教程带你从安装到跑通第一个任务。先看效果一句话需求变成目录里的文件它的输入输出非常直白你说的话输入AI 做的你得到的输出下载这两个站点上最小的文档文件打开页面→读页面→点链接→等下载完成→再点下一个文件已躺在你指定的目录里随时可取整个过程它像真人一样操作先看一眼页面判断哪个链接才是目标文件点击后等待下载完成再回到列表处理下一个。你唯一的参与是把需求说明白。上图就是 AI 在真实浏览器里打开并操作过的页面。它能处理的远不止下载页表单、商城、后台系统都能操作。能力边界browser-use 能做什么别指望什么它能稳做的别指望它做的按文字描述定位下载链接并触发下载PDF、DOC、CSV、ZIP 都常见绕过验证码、风控等反爬拦截文件直接落进你指定的目录目录结构由它规划通过需要人工扫码的强认证流程下载后自动重命名、分类还能接后续处理在完全无网的离线环境里工作多站点、批量、定时重复跑同一套任务一次运行处理需要人工判断的灰色边界它接管一切人看一眼就知道怎么点的操作人也要摸索半天的坑它同样会卡住。上手指南十分钟装好跑通第一次 AI 自动下载环境要求不高Python 3.11 以上加一个 LLM 的 API Key下例用 Google Gemini。git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use pip install browser-use这是最小可运行示例全文就两段代码另一段在上面import asyncio import os from browser_use import Agent, Browser, ChatGoogle # 大模型换成你自己的 API Key llm ChatGoogle(modelgemini-2.5-flash, api_keyos.getenv(GOOGLE_API_KEY)) # 指定下载目录AI 会把文件存到这里 browser Browser(downloads_path~/Downloads/auto_downloads) async def main(): agent Agent( task访问 https://file-examples.com/ 下载最小的 DOC 文件 然后回到列表继续下载最小的 XLS 文件, llmllm, browserbrowser, ) await agent.run(max_steps25) # 最多跑 25 步防止失控 if __name__ __main__: asyncio.run(main())运行前检查两件事模型的 API Key 环境变量已设置、下载目录有写权限。这两点是新手翻车最多的地方。跑起来后你会看到浏览器自动打开→AI 读页面→点中 DOC 链接→等下载完成→回到列表→再点 XLS 链接。两个文件落进auto_downloads目录单步耗时取决于模型响应速度全程不用你干预。原理拆解AI 是怎么看懂网页的它并不看网页处理的是文本和截图。browser-use 把这拆成三个角色菜单。浏览器扩展browser_use/dom/serializer/把当前页面的按钮、链接、输入框序列化成一份带编号的可点击清单喂给 AI。就像餐厅菜单每道菜有编号AI 只要说来 37 号。它不写死任何网站的规则而是每次现读现理解——这是它能看懂陌生网站的根本原因。服务员。browser_use/agent/service.py里的 Agent 接到编号后真正动手点击、填表、滚动、翻页每一步都记进执行历史出错还能回看纠正。质检员。下载从点击到落盘中间有跳转、有进度browser_use/browser/watchdogs/downloads_watchdog.py全程盯着开始、进度、完成三个事件网络抖动导致文件没下全时自动重试。另外browser_use/browser/profile.py的 BrowserProfile 可以预设下载目录、登录态等参数是进阶配置的主入口。进阶玩法三个高频 AI 浏览器自动化场景物流运营归档。任务去承运商后台把上月的运单 PDF 逐份下载按运单/2026-08存好。它替你登录、翻页、逐个下载、落目录原来半天的活趁你喝咖啡就做完了。电商规格表收集。任务去某品牌官网把全线产品的规格表 PDF 存到规格/产品线文件夹。它替你逐个逛产品页、下载、按文件夹归类你只负责验收。HR 岗位资料收集。任务把招聘站上每个岗位的职位描述 PDF 按职能分类下载。它替你翻站、下载、命名归档后续改 JD 直接查文件夹。细节写法可以参考 examples/ 目录里的下载与文件系统示例。避坑指南新手最常踩的三个坑症状原因解法文件消失了哪里都找不到没传downloads_path文件去了系统临时目录的随机文件夹先指定下载目录再跑任务这是第一课AI 在登录页反复打转站点需要登录任务里没有会话先用 examples/browser/save_cookies.py 手动保存一次 Cookie/存储状态再传给任务复用找不到下载按钮乱点半天任务描述太含糊描述里带上筛选条件、文件格式、保存规则比如下载报价单区域最新的 PDF按供应商名命名跑几步弹出验证码卡死站点风控拦截换更强的模型重试或改到风控宽松的时间段跑适用判断谁该用 browser-use模型怎么选该用任务重复、规则清晰、量级上来比如每天超过 30 个文件日报收集、批量导出、定时归档都是甜区。别硬用一次性随手下一个文件配环境的时间比手动点多。工具的价值在重复的复利——配一次以后每次都省时间。模型怎么挑browser-use 支持 OpenAI、Claude、Gemini、DeepSeek 等主流模型差距明显强模型稳但贵小模型便宜但容易跑偏。参考官方基准里各模型的任务成功率个人尝试从便宜模型起步正式流程再换强模型这是性价比最高的路线。今晚就把任务那行换成你自己的真实需求跑一遍。等它替你点下第一个下载按钮以后重复的另存为和改名就不用再动手了。【免费下载链接】browser-useAgents that use the browser.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考