Bardeen 是什么?浏览器 Agent 的反身一击,把结构化抓取降级成了编译问题(基础篇)

Bardeen 是什么?浏览器 Agent 的反身一击,把结构化抓取降级成了编译问题(基础篇)

又一个被 ChatGPT 逼出来的转型案例。

Bardeen 这个名字你可能第一次听。它 2020 年成立,2021 年做的事情和你见过的所有自动化工具一模一样:装个浏览器插件,把你在网页上重复点的动作记下来,一键回放。宣传语就是”Zapier 的免费替代”。

然后 ChatGPT 来了。

2026 年 9 月 5 日,Bardeen 搞了个叫 “Gen-AI-uary” 的一周连发,把定位整个撕掉重来。现在打开他们官网,第一句话是”Find and reach leads no one else can”——找那些别人找不到的销售线索。这已经不是自动化工具了,这是 GTM(市场进入)赛道的一把手术刀。

它现在到底是什么

说人话:四个动作串成一条闭环。

从任意网站扒数据。 LinkedIn、Product Hunt、Crunchbase、Zillow,官网的说法是”你想得到的数据都能扒”。注意这是浏览器里跑,不走官方 API——所以很多没开放接口的网站它照样能读。

AI 搜索做研究。 你描述理想客户画像,AI 自己去全网跑一轮,把答案写成行。

联系方式补全。 拿到名字后自动查邮箱、电话、社交账号,顺带验证邮箱真伪。这一步是传统 ZoomInfo 那类工具的核心价值,它直接塞进了同一个平台。

AI 打分排序。 还是你描述理想客户,AI 按优先级排好,销售知道先打谁。

以前这套流程你得在四五个工具之间来回切,现在一个平台跑完。转型的全部逻辑就在这儿。

BardeenAgent 的 Record-Replay 抓取工作流:先录制第一条,再生成可执行程序批量回放
BardeenAgent 的核心:模型只演示一次,剩下交给 HTML 的规则性批量跑

真正值钱的东西:一次演示,批量执行

这是它唯一值得单独拿出来讲的技术点,而且有正经论文,不是营销话术。

Bardeen 顺手做了个基准叫 WebLists(arXiv 2504.12682):50 家公司(Forbes Cloud 100)的网站,200 个结构化抓取任务,四类场景——招聘岗位、岗位分类、博客文章、客户评价。

跑出来的结果很扎心:

方法 综合召回率
LLM + 搜索 3.3%
Agent-E(当时 SOTA) 12.1%
Wilbur(Bardeen 自家上一代) 30.5%
BardeenAgent 66.2%

顺带一提,Agent-E 那 12.1% 里精确率其实高达 58%——它”看得准”但”漏得多”,典型的抓一半就交差。

BardeenAgent 的解法朴素得有点反常识:别让模型一条条抓,让它只抓第一条,把这第一条的动作录成一个程序,然后利用网页 HTML 的规则性——列表项结构是长得差不多的——把这个操作泛化到所有条目上。

论文里叫 Record-Replay 两阶段。录制时,Agent 碰到列表会主动把观察范围收窄到第一项,只存这一项的 CSS 选择器和取值动作;录制结束,编译成一个可执行程序,列表结构直接变成循环和翻页。跑的时候一行 LLM 调用都没有,纯程序执行。

省下来的钱很实在:每行数据的成本降到对手的三分之一。

那个唯一的例外是 AnswerQuestion 工具——当页面上确实没有单一元素能装下你要的字段、正则也匹配不上时,才让 LLM 逐行回答一次。这是整个流程里唯一按行烧 token 的地方。

所以这个架构的本质,是把”结构化抓取”这件事从 Agent 问题降维成了编译问题。模型负责一次性把规则写出来,程序负责跑一万遍。

上手有多快

装插件。 Chrome 商店里 20 万+ 用户,评分 4.4,v5.0.0(2026 年 6 月更新)。快捷键 Alt+B(Mac 是 Option+B)在任何页面唤起。

100 积分免费。 官方定价页写得很直白:每个输出行算 1 积分,联系方式补全算 3 积分,导入导出和 CSV 下载不要钱,积分月底清零不累积。

付费档位。 Basic 每月 $10 起(只有爬虫,不含补全),Premium 每月 $50 起(1000 积分,加补全和团队功能),Premium 年付 $480 一年 12000 积分,Enterprise 单独报价。

账号数据默认不出浏览器。 官网安全页写明:连着的应用数据只存在本地浏览器缓存,不上云。只有付费用户勾了”浏览器关掉也要跑”时,才会有实例在他们的服务器上跑,而且那个实例没有存储能力,跑完即焚。他们持有 SOC 2 Type II 和 CASA Tier 2/3 认证。

上手门槛确实低:给一句人话目标,AI 生成流程,跑一遍看结果,不对就改。非技术岗能自己搞定,才是这类工具活下来的理由。

实话

第一,65% 的召回率离”生产可用”还差一截。 这不是说 Bardeen 差,是说整个浏览器 Agent 赛道都还差一截。66% 意味着抓 100 条准 66 条,剩下 34 条要么空要么错。论文里专门说了这是为了兼顾纯问答任务(会掉到 60%),两者不可兼得。

第二,回放靠 HTML 结构,网站一改就得重录。 这是 Record-Replay 的软肋。录制时生成的选择器绑定在当前页面结构上,对方改版、换模板、加个 A/B 测试,程序就哑了。规模越大维护越痛苦,而养爬虫模板本身就是脏活。

第三,这已经不是开源项目了,别按开源的标准去审它。 官网连 GitHub 组织页都是空的(10 个公开仓库,最高 1 星,全是历史 SDK 和 fork)。这不是开源,这是闭源 SaaS。你判断它靠的是融资和客户名单,不是代码。

第四,它躲不开 Clay。 从”啥都能干一点”收窄到”销售线索这一条线”,这在 AI 时代是活下来的标准动作,因为基础能力一旦成为商品,数据资产和垂直理解才是护城河。但 Clay 在数据覆盖上有自己的先发网络效应,而 Bardeen 明确不碰 CRM、不碰邮件营销,就守着”找线索”这一段。克制是对的——不跟 Salesforce、HubSpot 硬碰;但也压住了单客户价值。

第五,成本口径不能跟 Zapier 直接换算。 Bardeen 按输出行收费,Zapier 按成功动作数收费,两者量纲不一样,同一批线索两边都会各收一遍。想省钱先想清楚哪段活该谁干。

适合谁: 需要从没有 API 的网站扒结构化数据、做线索研究和联系方式补全的销售、招聘、市场团队。

不适合谁: 找”通用自动化平台”的(那该看 Zapier 和 Make),以及想要开源自托管的(这项目根本没开源)。

署名

2021 年 Bardeen 靠浏览器插件在 Zapier 影子里找到了位置,2026 年它把这个影子彻底扔了。

这已经是这两年 Agent 赛道反复出现的剧本了。基础能力一旦被大模型抹平,还活着的就得是那个握着垂直数据资产、跑在别人 API 够不着的地方的那个。

所以 Bardeen 那篇论文真正有意思的地方,不是 66% 这个数字,而是它证明了:在 Agent 处理不了的活儿上,把它降级成编译器,比死磕模型聪明得多。

值得一看。

by 数码罗记 · godsun.pro

本文数据核实于 2026 年 10 月 5 日。融资与客户信息来自 BusinessWire、TechCrunch、CB Insights 与 Bardeen 官方公告;召回率与成本数据来自 arXiv 2504.12682(WebLists 基准);定价与积分数来自 bardeen.ai/pricing 与安全页;插件版本与用户数来自 Chrome 网上应用店。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注