先把这个概念掰开说清楚,因为太多人混淆了"关键词提取"和"关键词研究"这两件事。关键词提取是从页面内容里把重要的词挖出来——它回答的问题是"这个页面在讲什么"。关键词研究是反过来,从用户的搜索行为出发找到值得做的词——它回答的问题是"用户想了解什么,我应该做什么内容"。前者的输入是URL,输出是词列表;后者的输入是一个种子词,输出是相关搜索词和它们的搜索量、竞争度。本文重点讲前者:给你一个网站或者一批URL,怎么快速提取出每个页面覆盖了哪些关键词。
两条技术路线对比:页内词频 vs 搜索引擎数据
| 对比维度 | 页内词频路线 | 搜索引擎数据路线 |
|---|---|---|
| 数据来源 | 页面HTML源码,统计词频和位置权重 | 搜索引擎排名数据库,已有搜索量数据 |
| 回答的问题 | "这个页面写了什么词" | "这个页面在搜索引擎里排什么词" |
| 100个页面产出词量 | 2000-5000个词 | 5000-15000个词 |
| 噪音比例 | 高(通用词、停用词混入) | 低(都是真实有搜索量的词) |
| 能否发现新机会词 | ❌ 只能分析已有内容 | ✅ 能发现页面未覆盖但有搜索量的词 |
| 代表工具 | 爱站、Screaming Frog、自建脚本 | 5118、Ahrefs、SEMrush |
一、5118页面关键词分析:输入URL,3秒出87个词+搜索量+排名
5118在国内SEO工具里最核心的差异化能力是它的搜索引擎排名数据库——它维护了一个海量的百度搜索排名快照,记录了数百万个域名在哪些关键词下有排名。这个数据库驱动了它最实用的功能之一:页面关键词分析。
操作路径极短:打开5118 → 工具菜单 → 页面关键词分析 → 输入一个URL → 点查询。3秒内返回三组数据:
- 该页面在百度有排名的关键词列表:每条词带搜索量、排名位置(第1页第1位还是第5页第8位)、排名URL、排名标题。一个中等规模的电商产品页(约1500字正文)通常有50-150个有排名的词,其中20-40个在搜索结果前3页,剩下的分布在4-10页。
- 页内高频词统计:按词频排序的TOP 50词,附带词频、密度百分比、在title/h1/h2等位置的出现次数。这部分和爱站类似,但5118做了去停用词处理,不会把"的""了""在"等虚词混进去。
- 竞品页面关键词对比:输入你的页面URL和竞品URL,5118会列出"你有他没排的词"和"他有你没排的词"。这部分对竞品分析的价值远超单页面分析——你能直接看到竞品页面覆盖了哪些你没有的关键词。
5118的批量能力是一个需要单独说明的点。它的"页面关键词分析"功能本身不支持批量URL输入——你需要一个一个输入URL查询。但它有一个"批量查排名"功能,可以一次输入5万个域名或URL,批量查询这些页面在百度里排了哪些词。所以实际操作路径是:先批量查排名拿到5000-15000个高质量关键词,再针对重点页面逐个做精细分析。会员价格从免费版(基础功能限制)到专业版¥199/月(支持批量查排名和深度分析),企业版¥499/月(API接入+数据导出不限量)。
5118批量提取关键词的实操流程
1. 把100个竞品URL整理成一个列表(txt或Excel导入)。
2. 用5118"批量查排名"功能提交URL列表,等5-15分钟返回结果。
3. 导出CSV,得到每个URL在百度排名的关键词、搜索量、排名位置。100个URL通常产出3000-8000条词。

4. 在Excel里按搜索量降序排列,筛选出搜索量大于100且竞品排前3页但你不在前3页的词——这些就是你的内容机会词。
5. 针对TOP 20机会词对应的竞品URL,逐个用"页面关键词分析"做精细拆解,看竞品页面结构和你的差异。
二、爱站页面关键词密度:免费方案里中文分词最成熟的
爱站(aizhan.com)的页面关键词密度工具走的是纯页内词频路线——它不依赖任何搜索引擎排名数据,只分析你输入URL的HTML源码,用中文分词算法把页面内容切成一个个词语,然后统计每个词的出现频率和在关键位置(title、meta keywords、H1、加粗标签、alt属性)的分布。
爱站的分词质量在免费工具里算第一梯队。它不像很多免费工具那样粗暴地用"连续两个字"来分词(比如"真皮沙发"被切成"真皮"和"沙发"两个独立词),而是基于自己的中文词库做精准分词,能正确识别"真皮沙发""客厅装修""北欧风格"这类复合关键词。分完词之后,爱站会输出一张关键词密度表:每个词在页面中出现了多少次、密度百分比是多少、出现在title/H1/strong标签中的次数各是多少。
这个数据对两个场景特别有用。第一个是SEO自检——你的目标关键词在页面中出现的频次和位置是否符合优化预期?如果目标关键词只在正文里出现了2次且不在H1里,密度低于0.5%,那搜索引擎大概率不会认为这个页面跟该关键词强相关。第二个是竞品页面结构逆向分析——把排名前3的竞品页面丢进爱站,看它们各自在title和H1里放了什么词、正文关键词密度是多少,横向对比就能发现自己的页面在关键词布局上的差距。

爱站的限制也很明确:免费版每次分析1个URL,不支持批量,每天有查询次数上限(大约30-50次)。付费会员¥99/月起解锁更高查询频次,但依然不支持批量URL分析。100个页面需要手动逐个输入,一个下午只能分析完30-40个。
三、Screaming Frog:批量爬100个页面,导出全站关键词数据
Screaming Frog在整站下载那一篇里提过它的爬取能力,但它还有另一个被低估的功能:关键词提取。爬完一个网站后,在Screaming Frog的"Keyword"标签页里可以看到每个页面的关键词密度分析——包括标题关键词、正文词频、H1关键词、图片alt关键词等。
和爱站、5118相比,Screaming Frog做关键词提取有两个独特优势。第一是真正的批量——你不需要逐个输入URL,直接输入域名,Screaming Frog自动爬完全站所有页面并同时完成关键词提取,500页的站15-20分钟全部跑完。第二是数据维度的完整性——它不仅告诉你每个页面有什么关键词,还同时告诉你这个页面的HTTP状态码、标题标签、meta description、内部链接数、外部链接数、页面大小、加载速度。你可以在一个界面里同时看到"这个页面覆盖了哪些关键词"和"这个页面的SEO基础状况如何",不用在两个工具之间切换。
但Screaming Frog的中文分词能力不如爱站。它内置的是通用的Unicode分词规则,对中文复合词的识别精度偏低——"真皮沙发"可能被切成"真皮""沙""发"三个词。而且Screaming Frog没有任何搜索引擎排名数据,它只能告诉你页面里有什么词,不能告诉你这些词有没有搜索量、有没有人在搜。
价格方面:免费版限制500个URL,付费版£199/年(约¥1800/年),买一份全团队共用。

四款工具七维对比
| 对比维度 | 5118 | 爱站 | Screaming Frog | 自建脚本 |
|---|---|---|---|---|
| 数据来源 | 搜索排名库+页内词频 | 页内词频 | 页内词频+SEO审计 | 页内词频+任意数据源 |
| 批量能力 | ✅ 批量查排名 | ❌ 单页逐个 | ✅ 全站自动爬 | ✅ 无限定制 |
| 中文分词精度 | ★★★★★ | ★★★★★ | ★★★☆ | ★★★★★(用jieba) |
| 搜索量数据 | ✅ | ❌ | ❌ | ⚠️ 需接入第三方 |
| 竞品对比 | ✅ 内置 | ❌ 需手动 | ⚠️ 需导出后对比 | ⚠️ 需自己写逻辑 |
| 价格 | ¥199-499/月 | 免费+¥99/月 | £199/年 | 免费 |
四、Python自建脚本:jieba分词 + TF-IDF,30行代码批量跑100个页面
如果你有编程基础且需要高度定制化的关键词提取逻辑,Python + jieba是中文关键词提取的标配组合。jieba是目前最成熟的中文分词Python库,内置了TF-IDF和TextRank两种关键词提取算法,安装一条pip命令搞定,3行代码就能从一段文本里提取TOP 20关键词。
一个批量处理100个页面的最小可用脚本:
import jieba.analyse, requests, csvfrom bs4 import BeautifulSoupURLS = ['https://competitor1.com/product-a','https://competitor2.com/product-b',# ... 100个URL]with open('keywords.csv', 'w', newline='') as f:writer = csv.writer(f)writer.writerow(['URL', '关键词', 'TF-IDF权重'])for url in URLS:html = requests.get(url, timeout=10).textsoup = BeautifulSoup(html, 'html.parser')# 提取正文(去掉script和style标签)for tag in soup(['script', 'style', 'nav', 'footer']):tag.decompose()text = soup.get_text()# TF-IDF提取TOP 20关键词keywords = jieba.analyse.extract_tags(text, topK=20, withWeight=True)for word, weight in keywords:writer.writerow([url, word, round(weight, 4)])print(f'✅ {url}: {len(keywords)}个关键词')
这个脚本跑100个页面大约3-8分钟(取决于每个页面的加载速度),输出一个CSV文件,在Excel里用数据透视表汇总,能看到竞品之间关键词重叠和差异的全貌。自建脚本的灵活度是所有方案里最高的——你可以自定义分词词典(加入行业术语)、调整TF-IDF的权重策略(给title里的词加权)、接入百度/Google API补充搜索量数据、甚至把提取结果自动生成词云图片。代价是你需要写代码和维护脚本。
自建脚本的三个注意事项
1. 停用词过滤。 jieba默认不去除停用词,"的""了""是""在"这些虚词也会被当成关键词输出。需要加载一份中文停用词表(网上有现成的),在extract_tags之前先把停用词过滤掉。
2. 自定义词典。 行业术语如"真皮沙发""纳米涂层""变频压缩机"如果不在jieba默认词典里,可能被错误切分。准备一份行业术语词典文件,在脚本开头用jieba.load_userdict('industry_words.txt')加载。
3. 标题和正文的权重分离。 TF-IDF默认把全文当一段文本处理,不会区分title标签和正文内容。实际SEO中title里的词权重远高于正文。可以在脚本里单独提取title标签文本,给title里的词乘以1.5-2.0的权重系数。
五、选型速查:你的需求落在哪个区间
| 你的场景 | 推荐方案 | 理由 |
|---|---|---|
| 想知道竞品页面覆盖了哪些有搜索量的词 | 5118 | 唯一带搜索量数据的方案,¥199/月值这个钱 |
| 检查自己网站每个页面的关键词密度是否达标 | 爱站 + 免费额度 | 中文分词精度最高,每天免费30-50次够用 |
| 批量分析自己全站500个页面的关键词+SEO状态 | Screaming Frog | 全自动爬+SEO审计+关键词提取一站式 |
| 技术团队,需要高度定制化+免费方案 | Python + jieba | 灵活度最高,可定制分词词典和权重策略 |
| 只是想看看某个页面有哪些词,一次性需求 | 爱站免费版 | 输入URL就行,零学习成本 |
关键词提取这件事,免费方案和付费方案的差距不在"能不能提取"——爱站免费版和5118都能从页面里把词找出来。差距在于提取出的词有没有搜索量数据支撑。页内词频只能告诉你"页面写了什么",搜索排名数据才能告诉你"用户搜了什么"。如果你的目标是做竞品内容策略分析,每个月花¥199买5118的搜索排名数据,比花三天时间自己用爱站手动分析100个页面要划算得多。如果你的目标只是检查自己网站的关键词密度是否合理、有没有关键词堆砌的问题,爱站免费版完全够用。两条路线的产出不是一个量级,但对的需求不一样,选错路线才是真正的浪费。
