一个做独立站的朋友要调研某个细分行业的竞品,他以为"域名批量采集"就是找工具把行业关键词丢进去、自动爬出一堆相关域名。结果他试了ExpiredDomains.net——只能搜过期域名;试了Dynadot批量查询——只能查能不能注册;试了WHOIS批量——只能查已有域名的注册信息。折腾了两天,想要的"按行业关键词批量扒域名"一个工具都没搞定。
"域名批量采集"和"域名批量查询"是两件完全不同的事。查询是你已经有一批域名了,想知道它们能不能注册、什么时候过期、WHOIS信息是什么。采集是你连域名列表都没有,需要从互联网上的各种公开数据源里把它们扒出来。这篇文章不教你怎么查域名能不能注册,专门讲怎么从六大公开数据源大规模抓域名——每种数据源能扒到什么、用什么工具、有哪些坑。
一、域名批量采集和域名批量查询,差了一个"数据来源"
先把这个基本概念掰清楚,因为太多人把这两件事混为一谈。
域名批量查询:你已经有一份域名列表(自己想的、从别处复制来的、竞品分析整理的),需要一个工具帮你快速验证这些域名的状态——能不能注册、注册商是谁、什么时候过期、DNS指向哪里。输入是已知的域名列表,输出是每个域名的状态信息。代表工具:Dynadot批量查询、Namecheap Bulk Search、GoDaddy Domain Backorder。
域名批量采集:你连域名列表都没有,需要从互联网的公开数据源里把相关域名"扒"出来。输入是采集条件(关键词、行业、IP段、组织名),输出是从各数据源聚合来的域名列表。代表数据源:搜索引擎、SSL证书透明度日志、DNS反向解析、备案数据库、WHOIS反查、网站榜单。
| 对比维度 | 域名批量查询 | 域名批量采集 |
|---|---|---|
| 输入 | 已知的域名列表 | 采集条件(关键词/IP/组织名) |
| 输出 | 域名状态信息 | 从零生成的域名列表 |
| 典型场景 | 查备选域名能不能注册 | 竞品分析、行业调研、资产发现 |
| 数据来源 | 注册局/注册商API | 搜索引擎、证书日志、DNS、备案库等 |
二、六大公开数据源,各能扒到什么域名
域名采集的核心不是"用什么工具",而是"从哪扒"。不同的数据源覆盖的域名类型完全不同,选错数据源比选错工具更致命。
数据源一:搜索引擎(site语法 + 关键词)。最原始但最实用的采集方式。在搜索引擎里搜 site:某个行业词 或者直接搜行业关键词,从搜索结果页的URL里提取域名。比如搜"装修公司",结果页里会出现 zx123.com、shejiben.com、to8to.com 等装修行业的网站域名。手动翻页当然不现实,用采集器或自己写脚本自动翻页抓取。这个数据源的优点是能抓到"有真实内容的活跃站点"——搜索引擎收录了这些页面,说明它们确实在运营。缺点是翻页有上限(百度通常只显示前76页结果),而且需要处理反爬。

数据源二:SSL证书透明度日志(Certificate Transparency Logs)。这是目前域名采集效率最高的数据源,但知道的人不多。2018年起,所有公共CA机构签发的SSL证书都必须公开记录到CT日志中。这意味着——只要一个网站申请了HTTPS证书,它的域名就会出现在crt.sh这类CT日志查询平台上。你可以按组织名、域名关键词、甚至泛域名(如*.example.com)来搜索。比如在crt.sh搜"%.alibaba.com",能扒出阿里巴巴旗下几百个子域名。工具层面,有Domain Collector这类Python脚本可以直接对接crt.sh API批量拉域名。这个数据源的优点是数据全、更新快、完全公开免费,缺点是只能抓到申请过SSL证书的域名(HTTP-only站点不在里面)。
数据源三:DNS反向IP查询。很多网站共享同一台服务器或同一个IP段。如果你知道一个行业里某家公司的网站IP,做DNS反向查询(Reverse IP Lookup),就能找出同一台服务器上还托管了哪些域名。比如你知道某装修公司的网站IP是123.45.67.89,用viewdns.info或yougetsignal.com的反向IP查询,可能扒出同一台服务器上还有十几个装修行业相关域名。进阶玩法是IP段扫描——不是查一个IP,而是查整个C段(/24,256个IP),看这个IP段里托管了多少个行业相关域名。工具方面,SecurityTrails、Shodan、Censys都支持反向IP查询和批量IP段扫描。这个数据源的优点是能发现"隐藏"的关联站点——同一个老板的不同品牌站、同行的备用站等。
数据源四:ICP备案数据库。在中国大陆运营的网站必须进行ICP备案,备案信息是公开可查的。通过备案号反查或主办单位名称反查,可以扒出同一个公司备案了哪些域名。比如你知道某公司的备案号(页面底部通常有),在工信部备案查询系统或第三方备案工具(如beian.miit.gov.cn、icp.chinaz.com)里输入备案号,就能看到这家公司名下的所有域名。这个数据源的优点是数据准确、有法律效力,缺点是只覆盖中国大陆备案的域名,而且一个公司可能用不同主体备案来分散风险。
数据源五:WHOIS反查。WHOIS数据记录了域名的注册人信息(姓名/邮箱/公司名)。如果你拿到一个竞品的域名,查它的WHOIS注册邮箱,然后用这个邮箱做反查,就能找出同一个人或同一个公司用这个邮箱注册了哪些其他域名。工具方面,DomainTools的Reverse WHOIS是最强的商业方案(付费),免费的替代方案有whoisxmlapi.com(有免费额度)、whois.com的反查功能。这个数据源的价值在于发现"同一个老板"的站群。但2026年大部分注册商默认开启了WHOIS隐私保护,能反查到的域名越来越少。
数据源六:网站榜单和目录。Alexa Top Sites(已停更,但历史数据仍可用)、SimilarWeb Top Sites、BuiltWith技术栈反查、各类行业导航站/目录站。这些数据源不是"采集工具",而是"域名列表的现成来源"。比如BuiltWith可以查"全中国用了WordPress的网站",返回几万个域名列表。行业导航站(如hao123、2345分类目录)的某个分类下可能列了几百个行业相关域名。这个数据源的优点是省事——不用自己爬,直接拿现成的列表。
六大数据源速查:
| 数据源 | 能扒到的域名类型 | 覆盖范围 | 免费程度 | 核心工具 |
|---|---|---|---|---|
| 搜索引擎 | 有真实内容的活跃站点 | 中等,受翻页限制 | 免费 | 自定义爬虫、八爪鱼 |
| SSL证书CT日志 | 申请过HTTPS证书的所有域名 | 极大,全球范围 | 完全免费 | crt.sh、Domain Collector |
| DNS反向IP查询 | 同服务器/IP段托管域名 | 中等,取决于IP范围 | 部分免费 | SecurityTrails、Shodan |
| ICP备案数据库 | 中国大陆备案域名 | 仅限中国备案站点 | 免费 | 工信部系统、站长工具 |
| WHOIS反查 | 同注册人/同邮箱的域名 | 受限,WHOIS隐私保护增多 | 付费为主 | DomainTools、whoisxmlapi |
| 网站榜单/目录 | 各行业的头部和长尾站点 | 取决于榜单覆盖度 | 部分免费 | BuiltWith、SimilarWeb |
三、不同采集目标,选的数据源组合完全不一样
六大数据源各有侧重,但实际使用中几乎不会只用一种。根据采集目标来组合数据源,效率和效果差别巨大。
场景一:竞品调研——我想知道某个行业有多少玩家。推荐组合:搜索引擎(site:行业词) + SSL证书CT日志(按组织名搜) + 网站榜单(BuiltWith技术栈反查)。先用搜索引擎跑一遍行业关键词,抓出搜索结果里出现频率最高的域名;再用BuiltWith查"用了同一种建站技术/同一家主机商的网站",交叉验证;最后用crt.sh按行业头部公司的组织名拉域名,找出他们可能有的子品牌站。
场景二:站群关联分析——某家公司到底有多少个站。推荐组合:ICP备案反查 + DNS反向IP查询 + SSL证书CT日志。备案反查能直接看到同一主体下的所有备案域名;DNS反向IP查同一台服务器上还有什么站;crt.sh按组织名查子域名。三个数据源交叉验证,基本能把一个公司的域名资产扒干净。
场景三:域名投资——找有潜力的未注册域名。推荐组合:搜索引擎(挖行业关键词变体) + 网站榜单(看热门趋势) + 过期域名池(ExpiredDomains.net)。先用搜索引擎和榜单确定哪些行业/品类正在起量,然后针对性地在这些领域里挖关键词变体,批量查注册状态。过期域名池里主要看有自然外链的老域名——做站比新域名起步快很多。
场景四:安全资产发现——我自己的公司有多少域名暴露在外。推荐组合:SSL证书CT日志 + DNS反向IP查询 + 搜索引擎。用crt.sh按公司名、品牌名、常用域名模式(如%example%)全量拉;DNS反向IP查公司服务器IP段上托管的所有域名;最后用搜索引擎搜公司名+site:,看看有没有被搜索引擎收录但公司自己都不知道的子域名。
四、三款工具能覆盖大部分采集需求,不用每个数据源单独学
六大数据源听起来多,但实际上不需要每个都单独学一套工具。三款核心工具能覆盖80%的采集场景。
crt.sh(免费,无需注册)。SSL证书CT日志查询平台。打开 crt.sh,输入 %域名关键词% 就能搜。比如搜 %装修% 或 %.zhuangxiu.% 能扒出所有包含"装修"拼音的域名里申请过SSL证书的。输出结果包含域名、证书签发时间、签发机构。可以直接导出CSV。进阶用法:用它的PostgreSQL接口(crt.sh提供了公开的数据库连接),可以写SQL做更复杂的查询。

SecurityTrails(有免费额度,付费$49/月起)。全能型域名情报平台。支持DNS反向IP查询、WHOIS历史、子域名枚举、关联域名发现。核心优势是它的"关联域名"功能——输入一个域名,自动通过DNS记录、WHOIS邮箱、IP、名称服务器、SSL证书等多个维度,发现跟它有关联的其他域名。免费版每月50次查询,付费版不限量。
自定义Python脚本(免费,需开发能力)。如果你需要定期、大批量、定制化地做域名采集,最灵活的方式是自己写脚本。核心逻辑:定义一个域名采集类,封装六大数据源的请求方法 → 多线程并发请求 → 结果去重合并 → 输出Excel/CSV。搜索引擎爬取用requests+BeautifulSoup解析搜索结果页;crt.sh用requests直接调API接口(https://crt.sh/?q=%25keyword%25&output=json);DNS反向查询调viewdns.info或SecurityTrails的API。一个中等规模的采集任务(100个关键词×6个数据源),脚本跑10-20分钟能出几千个去重域名。
| 工具 | 覆盖数据源 | 费用 | 上手难度 | 最适合 |
|---|---|---|---|---|
| crt.sh | SSL证书CT日志 | 免费 | 低 | 快速扒子域名、按组织名搜 |
| SecurityTrails | DNS+WHOIS+证书+IP | 免费50次/月,$49/月起 | 低 | 关联域名发现、全维度分析 |
| 自定义Python脚本 | 全部六大源 | 免费(服务器成本) | 中高 | 定期大批量定制化采集 |
五、采集完的域名怎么验证和筛选——四个必过的检查项
六个数据源扒回来的域名列表,原始数据通常是几千到几万个。这些域名里有大量垃圾——已经打不开的、跟行业无关的、被搜索引擎惩罚过的。采集只是第一步,后面的筛选才决定你能不能用。
检查一:域名是否可访问(HTTP状态码)。批量发HEAD请求,检查返回的HTTP状态码。200正常;301/302重定向(要看重定向到哪里,可能是域名停靠页);403/404/500直接淘汰。用Python的requests库批量跑,几千个域名几分钟搞定。
检查二:域名是否被搜索引擎收录。在百度/Google里搜 site:域名,看有没有返回结果。如果site:结果为0,说明这个域名没有被搜索引擎收录——要么是新站,要么被惩罚了,要么内容质量太低。用采集器批量查site:收录状态,有收录的保留,没收录的标记为"待观察"。
检查三:域名历史和SEO指标。用Ahrefs/Moz/SimilarWeb查域名的DA/DR、外链数量和质量、历史流量趋势。DA<10的新域名适合做新站;DA20-40有外链基础的适合做内容站快速起量;DA>40的高权重域名适合做主站或导流站。同时检查域名历史——通过Wayback Machine看这个域名以前做过什么内容,有没有被用来做灰色行业。
检查四:域名注册状态和价格。把筛出来的域名列表导进Dynadot或Namecheap的批量查询,看哪些能注册、哪些已被注册、哪些在拍卖。能注册的直接注册,被注册的评估要不要买(价格是否合理),在拍卖的设好预算上限避免冲动竞价。
六、域名采集最容易踩的三个坑,每个都能让你白干一天
坑一:搜索引擎爬太快被封IP。这是最常见的坑。搜索引擎对自动化请求极其敏感,同一个IP短时间内发送大量搜索请求,几分钟内就会被封。解决方案:控制请求间隔(每次搜索间隔3-5秒)、使用代理IP池轮换、模拟正常浏览器的User-Agent和请求头。如果采集体量大,建议用付费的SERP API(如SerpApi、BrightData),它们自带IP轮换和反反爬。
坑二:六大数据源各采一遍,结果不去重也不交叉验证。不同数据源会采到大量重复域名,不去重的话列表里一半是重复的。更关键的是,同一个域名在不同数据源里出现,本身就是一种验证信号——如果某个域名同时出现在搜索引擎结果、crt.sh证书日志和BuiltWith技术栈里,说明它是个真实活跃的站点;如果只在一个数据源里出现,可能是个垃圾站或已废弃的站。
坑三:采完不建档,下次从头再来。域名采集不是一次性工作。今天采了2000个装修行业域名,下个月竞品又多了、又有些站关了。如果没有一个持续更新的域名资产库,每次做分析都得重新采。建议用Excel或飞书多维表格建一个简单的域名库:域名 + 来源数据源 + 采集日期 + DA/DR + 收录状态 + 备注。定期(每月)增量更新——只采新增的域名,更新已有域名的状态。
七、从手工采集到系统化域名资产管理
前面讲的都是"手工或半自动采集"——人决定采什么、选哪些数据源、跑工具、筛结果。这在管理十几个域名的时候没问题。但如果你在做站群,手里有几十上百个域名分布在不同的行业、不同的地区,手工采集完全跟不上。
这时候需要的不只是"采集工具",而是一套把域名采集→验证→筛选→注册→部署→监控打通的系统。UC建站系统在这件事上的思路是:域名资产作为站群基础设施的一部分,跟内容生产系统联动——系统自动按行业/地区做域名采集,自动交叉验证数据源可信度,自动对接注册商API批量查状态,注册完成后自动配置DNS、部署SSL、对接内容中台推送初始内容。人只需要做两件事:定采集策略(选数据源、设筛选条件)、最终确认要注册的域名列表。
这种系统化方案和手工采集的核心差距不在"能多采几个域名",在于采集结果能直接转化为可部署的资产——手工采集的终点是一份Excel,系统化采集的终点是一个已经上线、配好SSL、有初始内容的网站。前者到后者之间还有大量手工操作,而这恰恰是大部分站长卡住的地方。
