首页/新闻资讯/正文详情

用 browser-use 把每周 40 分钟的另存为压到 3 分钟自动下载

发布时间:2026/9/24 23:58:49 来源:云帆数科 栏目:资讯中心
用 browser-use 把每周 40 分钟的另存为压到 3 分钟自动下载
用 browser-use 把每周 40 分钟的另存为压到 3 分钟自动下载【免费下载链接】browser-useAgents that use the browser.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use5 个站点、14 次右键另存为、每周 80 分钟这就是你手工收集一套供应商报表的总代价。browser-use 是一个让 AI 直接操作浏览器的开源框架你给它一句话任务它就自动下载网页文件并保存到指定目录全程不用碰鼠标。先看它跑起来什么样子全程 6 个步骤前 5 步都由它完成你唯一要做的是把任务说明白。步骤它做了什么你看到的结果1 启动并打开页面启动浏览器加载目标站点页面浏览器窗口弹出页面加载完成2 理解页面把页面元素序列化成带编号清单交给模型比对任务终端输出当前页面的可读摘要3 定位目标按任务描述找到月度报表 PDF入口锁定对应按钮或链接4 触发下载点击按钮监听下载开始与进度事件浏览器底部出现下载进度5 校验落盘下载完成后检查文件是否完整指定文件夹出现新文件6 汇报结果输出步骤摘要与文件清单终端显示完成下一文件重复该流程你全程只需要做的一件事把任务写成一句话并指定文件存到哪里。这是 agent 在真实浏览器中打开并操作过的页面说明它能处理的不只是下载页还包括表单、商城和后台系统。整个过程由 browser_use/browser/ 中的事件机制驱动不需要为任何网站写死规则。所以这不是右键另存为的快捷方式而是一条自动下载流水线。三步把它跑起来从安装到文件落地3 步大约 10 分钟。装环境运行前提 3 条Python 3.11 或更高版本项目要求3.11一个 LLM 的 API Key 设为环境变量本文示例用 Google 的GOOGLE_API_KEY下载目录已存在且当前用户有写权限git clone https://gitcode.com/GitHub_Trending/br/browser-use cd browser-use pip install -e .写任务import asyncio import os from browser_use import Agent, Browser, ChatGoogle llm ChatGoogle(modelgemini-2.5-flash, api_keyos.getenv(GOOGLE_API_KEY)) # 指定下载目录不指定时文件落在随机临时目录 browser Browser(downloads_path~/Downloads/auto_downloads) async def main(): agent Agent( # 任务带上筛选条件和格式越具体成功率越高 task访问 https://file-examples.com/ 并下载最小的 DOC 文件, llmllm, browserbrowser, ) await agent.run(max_steps25) # 限制步数防止无限循环 asyncio.run(main())看结果运行后浏览器窗口弹出终端逐步打印读了什么、要点什么自动下载完成后文件落在~/Downloads/auto_downloads。首次失败多数不是代码问题而是任务描述缺筛选条件。本文示例参照仓库里的 examples/features/download_file.py。⚠️ 任务结束但文件消失 → 未设置downloads_path文件默认存进系统临时目录的随机文件夹 → 跑任务前先把downloads_path写进Browser(...)。所以文件落到指定目录就代表环境这一关已经过了。它凭什么看懂网页自动下载之所以能在任意网站上稳定工作靠的是 2 个机制把页面变成带编号的操作清单以及盯住下载全程。机制一页面 → 带编号操作清单大白话定义把当前页面的按钮、链接、输入框整理成一份带编号的清单AI 只回答点 37 号它就真的去点 37 号。信息流是这样的输入 当前页面 DOM → 处理 序列化组件遍历元素、过滤不可见与不可点击项、依次编号 → 输出 带编号操作清单连同页面截图一起交给模型。源码在 browser_use/dom/序列化逻辑集中在该目录的 serializer 模块里。机制二盯住下载全程不完整就重来大白话定义下载不是点一下就完事有跳转、有进度这个组件从开始、进度到完成全程监听文件没下全会触发重试。信息流输入 浏览器的下载事件 → 处理 DownloadsWatchdog监听开始、进度、完成三个阶段 → 输出 完整文件落到downloads_path。实现位于browser_use/browser/watchdogs/downloads_watchdog.py。所以机制一让它知道点什么机制二让它等文件安全落袋两者都不依赖写死的网站规则。三个让批量任务跑得稳的升级项从能跑到敢放一整天无人看管做 AI 自动保存报表差的是 3 个配置目录、登录态、失败兜底。参数作用建议值downloads_path下载落盘目录~/reports/站点名/年-月storage_state复用登录态与 Cookieexport_storage_state()导出的文件路径max_steps单任务步数上限单文件 25批量 100fallback_llm主模型失败时的备用模型便宜且快的模型固定目录与子文件夹批量下载网页文件时把落盘目录写进downloads_path分类规则按站点、按月份直接写进任务描述AI 会自己建子文件夹存放。目录建议一级站点名、二级年月形如downloads_path~/reports/供应商A/2026-09。登录态复用需要登录的站点先手动登录一次并导出状态之后每次任务带一个参数即可跳过登录页。导出流程见 examples/browser/save_cookies.pybrowser Browser( downloads_path~/reports/2026-09, storage_statestorage_state.json, # 复用登录态 )失败重试与步数上限用max_steps给整个任务设步数上限防止在页面上打转主模型超时或输出异常时fallback_llm自动接管例如fallback_llmChatGoogle(modelgemini-2.5-flash)配合await agent.run(max_steps100)。⚠️ AI 下错文件或反复折返 → 任务描述缺少筛选条件和规则 → 任务里补三样下哪个文件筛选条件、什么格式、存到哪里。所以这 3 个配置加上十几个文件的批量任务可以无人值守过夜跑早上看一眼结果就是全部人工成本。什么活该交给它什么活别硬塞判断标准一条活是否重复、规则是否清晰是就交给它不是就手动。适合交给它建议手动固定一套报表的重复下载一次性保存单个文件多个站点的文件批量导出需要实时人工判断的下载每天每周定期重复的任务需要扫码登录的页面批量下载网页文件后按规则归档藏在多层动态弹窗里的下载官方基准里各模型成功率最高相差 54 个百分点这是强模型省心、弱模型易跑偏的直接证据。同一组测试的成本侧单次任务成本 1 美元以下时成功率普遍低于 40%预算拉到 5 美元以上才有模型突破 70%。强模型贵但稳弱模型便宜但容易跑偏先用成功率 65%~74% 档位的中档模型验证流程正式做 AI 自动保存报表再升级顶配。模型接入层实现在 browser_use/llm/。⚠️ AI 卡在登录页反复打转 → 需要登录的任务没处理登录态 → 先手动登录一次导出 Cookie再用storage_state复用。所以重复的活交给它一次性的别硬塞模型成本与成功率是一笔要算的账。行动清单3 条3 个验收动作每个今天就能完成。把筛选条件写进任务 → 跑 1 次 → 指定目录出现文件设定下载目录 → 下 1 个 PDF → 目标目录文件名完整加后备模型与步数上限 → 跑一夜 → 无卡死重复所以第一个验收标准是文件落地而不是过程。【免费下载链接】browser-useAgents that use the browser.项目地址: https://gitcode.com/GitHub_Trending/br/browser-use创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关推荐

修复20年前的C语言矩阵乘法代码:从KR语法到现代编译器的兼容之旅
修复20年前的C语言矩阵乘法代码:从KR语法到现代编译器的兼容之旅

上个月整理一台淘汰下来的旧工作站,从一个没有版本管理的备份目录里翻出了一份mat.c。文件修改时间是1999年7月,最顶上写着一行注释:33矩阵乘法,测试通过。我把它拖到当前环境里用 gcc 编译,警告满屏;加上-… · 2026/9/24 23:58:43

Qt 5.14.2 aarch64静态交叉编译实战:从环境搭建到内网部署
Qt 5.14.2 aarch64静态交叉编译实战:从环境搭建到内网部署

搞Qt的交叉编译,尤其是目标平台还限定在aarch64,又要静态链接,这事儿说大不大,说小也不小。如果只是用现成的SDK点点鼠标,那确实没什么好写的,但当你需要在一个纯内网环境里给国产ARM板子交付一套Qt程序&am… · 2026/9/24 23:58:43

设备租赁App开发实战:从租约状态机到库存预占设计
设备租赁App开发实战:从租约状态机到库存预占设计

1. 设备租赁行业的“资产账”,不是普通进销存能算清的1.1 设备租赁和销售的业务逻辑差异在哪销售业务里,商品卖出那一刻所有权就转移了,后续的维护、折旧、退换基本是独立的售后事件。而租赁业务完全不同:设备的所有权始终留在公司… · 2026/9/24 23:58:43

深度学习新闻分类推荐系统:从TextCNN到个性化推荐
深度学习新闻分类推荐系统:从TextCNN到个性化推荐

简介:这份基于深度学习的新闻分类推荐系统Python实现源码,是专为课程设计与期末大作业准备的高分项目,下载后无需修改即可运行,适用于需要快速交付完整课题的高校学生。系统涵盖新闻数据预处理、文本分类模型训练、推荐逻辑展示等… · 2026/9/24 23:59:53

汽车电子底层软件开发:AUTOSAR与CAN总线实战解析
汽车电子底层软件开发:AUTOSAR与CAN总线实战解析

1. 这门“汽车电子底层软件开发就业课”到底在教什么?——不是写个LED闪烁就能上岗的很多人看到“汽车电子底层软件开发就业课”这个标题,第一反应是:不就是嵌入式C语言单片机CAN通信?刷几道LeetCode、调通一个STM32 CAN收发例程&… · 2026/9/24 23:59:53

Vim基础操作全攻略:保存退出、模式切换与高频命令实战
Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保… · 2026/9/24 23:59:53

Python+CNN车牌识别实战:从数据预处理到模型训练与部署
Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据… · 2026/9/24 23:59:53

AI元人文:从工具使用到思维重构的深度探索
AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决… · 2026/9/24 23:59:53

《AI Agent 场景应用 - MobileOpenClaw》第5-9节:会话上下文细化处理实战指南
《AI Agent 场景应用 - MobileOpenClaw》第5-9节:会话上下文细化处理实战指南

文档教程后端 【免费下载链接】CodeGuide :books: 本代码库是作者小傅哥多年从事一线互联网 Java 开发的学习历程技术汇总,旨在为大家提供一个清晰详细的学习教程,侧重点更倾向编写Java核心内容。如果本仓库能为您提供帮助,请给予支持(关注、… · 2026/9/24 23:59:47

了解更多?预约专属演示

我们的顾问将为您一对一讲解产品与方案

企业微信二维码