[控场AI]
产品Browser Use框架

Browser Use

开源的事件驱动AI Agent框架,核心能力是让LLM根据自然语言任务描述自主驱动浏览器操作,支持多LLM供应商,采用分层解耦架构,整合浏览器控制、工具注册、Skills、Sandbox和MCP

核心事实

时间轴 (近 90 天)

9月25日

与 RPA 不同,Browser Use 不依赖预先录制的固定脚本,而是让模型实时理解页面语义,因此对页面改版的适应性更强

待验证50%
9月24日

Browser Use开发者将Browser Use与Jev结合完成自动订票,从打开Google Flights到筛选最便宜航班整个流程仅耗时约7秒,成本约0.0039美元

待验证50%
9月22日

Browser Use 公布的航班搜索案例中,使用 JEF 的中位耗时从 9.45 秒降到约 7.09 秒

待验证50%
9月21日

Browser Use 相比无头浏览器脚本(如 Selenium、Playwright)的优势在于可利用已有的登录态,无需重新处理验证码或 OAuth 流程

待验证50%
9月20日

一条 Twitter 评论称 Browser Use 是作者见过的最佳应用

待验证50%
9月18日

在 Browser Use 结合架构中,Jev 负责结构化决策,另一个小语言模型(演示中用 Mercury 2.5)负责生成文本输入,浏览器代码负责执行动作

待验证50%
9月17日

Browser Use、Browserbase 等框架封装了 LLM 调用层,以自然语言驱动浏览器操作

待验证50%
9月11日

DeepSeek Harness支持代码与文件系统操作、开发任务支持、协作与项目规划以及信息获取能力

已验证65%
9月11日

Creator 利用 QwenPaw 的 Browser Use 和 Computer Use 基建,让 Agent 能自动操作软件、截图或录屏以制作教学演示视频

待验证50%
9月10日

基于无障碍树的浏览器交互方案相比截图+视觉识别方案Token消耗大幅降低,且在表单填写、下拉选择等精细操作上可靠性更高

待验证50%

还有 5 条时间轴事件

全部知识事实 (20)

已验证

Browser Use底层通过Playwright驱动浏览器操作,借助大语言模型理解用户意图并逐步生成执行动作

80%
已验证

Browser Use提供DOM模式和视觉模式两种页面理解方式

80%
已验证

Browser Use是一个开源的AI网页自动化智能体(Agent),允许用户通过自然语言指令控制浏览器

75%
已验证

浏览器自动化Agent通过DOM解析、视觉识别或无障碍树(Accessibility Tree)来定位网页元素并模拟人类操作

75%
已验证

DeepSeek Harness支持代码与文件系统操作、开发任务支持、协作与项目规划以及信息获取能力

65%
待验证

Browser Use 的配置分为三个层级:配置文件(.env)→ 环境变量 → API 参数传入,优先级依次递增

95%
待验证

Browser Use 提供三种交互方式:命令行(CLI)、代码调用(Python API)以及在线云服务

95%
待验证

Browser Use 采用结构化返回(Structured Output)的方式与大模型交互,而非传统的 Function Calling

95%
待验证

Browser Use支持通过CDP(Chrome DevTools Protocol)或WebSocket连接到已有的浏览器实例,复用已有的登录状态和Cookie

95%
待验证

Browser Use 内置了十余种常用工具,涵盖搜索、点击、输入、截图等操作,并支持灵活的增删定制

90%
待验证

Browser Use 早期版本基于 Playwright 实现浏览器控制,最新版本已切换到 CDP(Chrome DevTools Protocol)

90%
待验证

Browser Use官方全面采用异步(async/await)方式编写代码,与Playwright的异步API天然契合

90%
待验证

Browser Use的Web UI版本基于Node.js开发,默认运行在7788端口

90%
待验证

Browser Use引入LLM作为理解层,不再依赖XPath或CSS选择器等硬编码规则来提取网页信息

85%
待验证

Browser Use等大模型驱动工具在每一步操作时需要将当前页面的DOM结构或截图发送给大模型进行推理,一个典型网页DOM序列化后可能超过数万Token

80%
待验证

阿里云曾在其技术文章中提到使用 Browser Use 作为核心智能体方案

80%
待验证

Browser Use的隔离环境(Sandbox)设计使AI操作的是一个独立的浏览器实例,与用户本机的浏览器会话完全隔离

75%
待验证

让同一个 AI 既写代码又测试代码,本质上是自己批改自己的作业,可能系统性忽略认知盲区中的 bug

70%
待验证

Browser Use 兼容多种主流大模型,包括 Ollama、OpenAI、Claude 等

60%
待验证

与 RPA 不同,Browser Use 不依赖预先录制的固定脚本,而是让模型实时理解页面语义,因此对页面改版的适应性更强

50%

来源文章