增长案例库 Maxed 归档 冷邮件与获客AI自动化

如何建立你自己的 100 万条线索数据库

how to build your own 1 million lead database

中文译文 · 6k 字

一句话摘要

教你构建 100 万条规模的销售线索数据库。

如何打造属于你自己的 100 万条线索数据库 2026 年 7 月 11 日 · 6 分钟阅读 · 查看原文 ↗ Claude 营销 你想触达的那些企业,已经列在某个公开的地方了。跨足够多的来源凑齐一百万家,不是什么遥不可及的事,只是把那些数据拉进一个你可以发信的格式,并且自己拥有这个数据库而已。 下面是完整的搭建方案,从工具到爬虫。 想要 500 条免费线索?maps.hiivearts.com 技术栈 三件东西就能跑起一切。 claude code。Anthropic 的编程代理,运行在你的终端里。你用大白话描述你想构建什么,它会写出代码、运行代码、并修复它自己的错误。你不需要知道怎么写爬虫。你需要知道怎么描述一个爬虫。 一台 vps。虚拟专用服务器是一台便宜的、一直开着的远程机器。你的爬虫在那里全天候运行,而不是在你的笔记本上,这样拉取几万条记录的任务可以趁你做别的事情时在夜里跑完。一台基础配置的每月只要几美元(对大多数爬取负载来说足够了)。 无头浏览器。很多目录网站是用 javascript 加载数据的,所以一个普通请求只会拉回来一个空页面。无头浏览器像真实浏览器一样打开网站,等内容渲染出来,然后读取它。当某个网站需要真实渲染时,claude code 会用 playwright 或 puppeteer 来搞定。 这就是基础。claude code 负责构建,vps 负责运行,无头浏览器负责那些需要真实渲染的网站。 拉取批量联系数据 在你构建任何定制东西之前,有大量的联系数据可以直接通过 API 拉取。 rapidapi 是这些 API 的一个集市。企业黄页、联系人补全、邮箱查找、公司数据,全都挂在你可调用的端点后面。你给某个供应商拿一个 api key,claude code 写一个短脚本,请求那个端点,把结果倒进一个文件。 如果你是大批量拉取,就把负载分散到几个不同的供应商和 key 上,而不是只用一家。每个 API 都有自己的覆盖范围和速率限制,所以在它们之间轮换能让你拿到更多记录,也避免任何单一来源在拉取中途对你限流。一个供应商可能在某个垂直领域很强、在另一个很弱,而重叠的部分正好填上缺口。 这能让你快速拿到一个结构化数据的基础,而不用为每个来源写爬虫。 构建定制爬虫 API 覆盖了那些常见来源。而没人去发邮件的那些线索,来自那些没有干净 API 的来源,定制爬虫就是为此而生的。 让 claude code 指向一个网站。一个牌照查询、一个协会成员名单、一个细分目录、一个非营利组织登记册。告诉它你想从每条列表里拿什么:名字、企业、邮箱、电话、网站、位置。它会写出爬虫、处理分页,并在 vps 上运行它。 当你开始从多个来源拉取时,真正要紧的部分是: 去重。同一家企业会以五种拼写出现在五个目录里。按名字、位置和邮箱域名匹配,把重复项折叠掉,否则你会花钱给同一个人发五次邮件。 核验。在发送之前,把邮箱跑一遍验证器,这样退信才不会毁掉你的域名信誉。 输出。写到一个 csv 或一个你可以查询的数据库里,这样你之后可以拉取一个特定的切片,而不是重新去爬源数据。 你把这些每一项向 claude code 描述一次,它就会把它们建进去。结果是一条你拥有的管线,只要你持续运行它,它就会持续拉取新鲜记录。 google maps 有一个来源值得单独拎出来讲。 google maps 是现存最大、最新的企业数据库之一。每一个想被找到的小企业都会把自己放上去,带着类别、位置、电话,常常还有网站,以及一个你可以当作粗略规模信号的公开评论数。它覆盖了海量的本地中小企业,而且越细分的领域发信的人越少,所以那些领域的回复率往往更高(因垂直领域和你的接触方式而异)。 它还自己保持最新。随着企业开业、倒闭、搬迁、积累评论,列表会随之变化,所以数据不会像一次性名单那样变陈旧。 规模化地好好爬取 maps,本身就是一个专门的工程。我们已经做完了。 步骤 选一个来源。一个目录、登记册、协会名单,或者含有你想要的企业的牌照查询。 打开网站,看它怎么布局。有没有分页?有没有搜索页?数据是不是点击才加载? 买一台便宜的 hetzner vps,在上面跑起 claude code。 把 URL 和你想要从每条列表里拿的确切字段告诉 claude code。 让它写爬虫,先在一个小样本上跑。 检查样本。字段对不对、值干不干净、有没有漏行。 如果页面返回是空的,让它加上无头浏览器处理。 样本没问题之后,跑完整拉取。 把输出跟你其他来源做去重。 在发送任何东西之前,先验证邮箱。 把干净记录写进你的 csv 或数据库。 把它排成定时重跑,让来源保持新鲜。 提示:关于这些步骤中的任何细节,都可以去问 claude code,并把这篇文章作为项目大纲给它,让它获得更多上下文。 捷径 我已经在内部为我们团队把这个建好了,三周前刚上线了一个 beta。 一个 google maps 数据库,直接给你。你选细分领域、城市、评论阈值、有没有网站,然后拉出你确切想要的那个切片。它是自助式的,所以你自己跑查询、自己拿名单。 你可以免费试用,拿到 500 条线索 -> maps.hiivearts.com 如果你想要整套系统——基础设施、仪表盘、知识库搭建、以及子序列自动化——都替你建好,我们聊聊。 cal.com/leviwelch/30min 链接 maps.hiivearts.com cal.com/leviwelch/30min cal.com/leviwelch/30min maps.hiivearts.com/ 标签:# X # Claude # 营销 # 增长 # 指南 # Google Maps 相关文章 如何打造一家 AI 原生公司:招聘、标准与节奏 *我们花了一年跑黑客松、AI 培训和 office hours。但什么都没变,直到我们把 AI 能力变成了一项硬性要求。* AI Loops Claude 营销

原文参考:https://maxed.wiki/posts/how-to-build-your-own-1-million-lead-database/ (Maxed.wiki,本页为站内中文整理)