用户登录
个人主页 用户中心 我的订单 添加授权 管理授权
退出登录
用户登录 用户注册
欢迎来到 UC建站系统

关键词提取的两条不同技术路线页面有什么词和用户搜什么词给了同样的URL一个返回87个词一个返回27个两种产出的差距不在精度而在底层逻辑完全不同

先把这个概念掰开说清楚,因为太多人混淆了"关键词提取"和"关键词研究"这两件事。关键词提取是从页面内容里把重要的词挖出来——它回答的问题是"这个页面在讲什么"。关键词研究是反过来,从用户的搜索行为出发找到值得做的词——它回答的问题是"用户想了解什么,我应该做什么内容"。前者的输入是URL,输出是词列表;后者的输入是一个种子词,输出是相关搜索词和它们的搜索量、竞争度。本文重点讲前者:给你一个网站或者一批URL,怎么快速提取出每个页面覆盖了哪些关键词。

两条技术路线对比:页内词频 vs 搜索引擎数据

对比维度页内词频路线搜索引擎数据路线
数据来源页面HTML源码,统计词频和位置权重搜索引擎排名数据库,已有搜索量数据
回答的问题"这个页面写了什么词""这个页面在搜索引擎里排什么词"
100个页面产出词量2000-5000个词5000-15000个词
噪音比例高(通用词、停用词混入)低(都是真实有搜索量的词)
能否发现新机会词❌ 只能分析已有内容✅ 能发现页面未覆盖但有搜索量的词
代表工具爱站、Screaming Frog、自建脚本5118、Ahrefs、SEMrush

一、5118页面关键词分析:输入URL,3秒出87个词+搜索量+排名

5118在国内SEO工具里最核心的差异化能力是它的搜索引擎排名数据库——它维护了一个海量的百度搜索排名快照,记录了数百万个域名在哪些关键词下有排名。这个数据库驱动了它最实用的功能之一:页面关键词分析。

操作路径极短:打开5118 → 工具菜单 → 页面关键词分析 → 输入一个URL → 点查询。3秒内返回三组数据:

  • 该页面在百度有排名的关键词列表:每条词带搜索量、排名位置(第1页第1位还是第5页第8位)、排名URL、排名标题。一个中等规模的电商产品页(约1500字正文)通常有50-150个有排名的词,其中20-40个在搜索结果前3页,剩下的分布在4-10页。
  • 页内高频词统计:按词频排序的TOP 50词,附带词频、密度百分比、在title/h1/h2等位置的出现次数。这部分和爱站类似,但5118做了去停用词处理,不会把"的""了""在"等虚词混进去。
  • 竞品页面关键词对比:输入你的页面URL和竞品URL,5118会列出"你有他没排的词"和"他有你没排的词"。这部分对竞品分析的价值远超单页面分析——你能直接看到竞品页面覆盖了哪些你没有的关键词。

5118的批量能力是一个需要单独说明的点。它的"页面关键词分析"功能本身不支持批量URL输入——你需要一个一个输入URL查询。但它有一个"批量查排名"功能,可以一次输入5万个域名或URL,批量查询这些页面在百度里排了哪些词。所以实际操作路径是:先批量查排名拿到5000-15000个高质量关键词,再针对重点页面逐个做精细分析。会员价格从免费版(基础功能限制)到专业版¥199/月(支持批量查排名和深度分析),企业版¥499/月(API接入+数据导出不限量)。

5118批量提取关键词的实操流程

1. 把100个竞品URL整理成一个列表(txt或Excel导入)。

2. 用5118"批量查排名"功能提交URL列表,等5-15分钟返回结果。

3. 导出CSV,得到每个URL在百度排名的关键词、搜索量、排名位置。100个URL通常产出3000-8000条词。

1 - 关键词提取的两条不同技术路线页面有什么词和用户搜什么词给了同样的URL一个返回87个词一个返回27个两种产出的差距不在精度而在底层逻辑完全不同 - UC建站系统

4. 在Excel里按搜索量降序排列,筛选出搜索量大于100且竞品排前3页但你不在前3页的词——这些就是你的内容机会词。

5. 针对TOP 20机会词对应的竞品URL,逐个用"页面关键词分析"做精细拆解,看竞品页面结构和你的差异。

二、爱站页面关键词密度:免费方案里中文分词最成熟的

爱站(aizhan.com)的页面关键词密度工具走的是纯页内词频路线——它不依赖任何搜索引擎排名数据,只分析你输入URL的HTML源码,用中文分词算法把页面内容切成一个个词语,然后统计每个词的出现频率和在关键位置(title、meta keywords、H1、加粗标签、alt属性)的分布。

爱站的分词质量在免费工具里算第一梯队。它不像很多免费工具那样粗暴地用"连续两个字"来分词(比如"真皮沙发"被切成"真皮"和"沙发"两个独立词),而是基于自己的中文词库做精准分词,能正确识别"真皮沙发""客厅装修""北欧风格"这类复合关键词。分完词之后,爱站会输出一张关键词密度表:每个词在页面中出现了多少次、密度百分比是多少、出现在title/H1/strong标签中的次数各是多少。

这个数据对两个场景特别有用。第一个是SEO自检——你的目标关键词在页面中出现的频次和位置是否符合优化预期?如果目标关键词只在正文里出现了2次且不在H1里,密度低于0.5%,那搜索引擎大概率不会认为这个页面跟该关键词强相关。第二个是竞品页面结构逆向分析——把排名前3的竞品页面丢进爱站,看它们各自在title和H1里放了什么词、正文关键词密度是多少,横向对比就能发现自己的页面在关键词布局上的差距。

2 - 关键词提取的两条不同技术路线页面有什么词和用户搜什么词给了同样的URL一个返回87个词一个返回27个两种产出的差距不在精度而在底层逻辑完全不同 - UC建站系统

爱站的限制也很明确:免费版每次分析1个URL,不支持批量,每天有查询次数上限(大约30-50次)。付费会员¥99/月起解锁更高查询频次,但依然不支持批量URL分析。100个页面需要手动逐个输入,一个下午只能分析完30-40个。

三、Screaming Frog:批量爬100个页面,导出全站关键词数据

Screaming Frog在整站下载那一篇里提过它的爬取能力,但它还有另一个被低估的功能:关键词提取。爬完一个网站后,在Screaming Frog的"Keyword"标签页里可以看到每个页面的关键词密度分析——包括标题关键词、正文词频、H1关键词、图片alt关键词等。

和爱站、5118相比,Screaming Frog做关键词提取有两个独特优势。第一是真正的批量——你不需要逐个输入URL,直接输入域名,Screaming Frog自动爬完全站所有页面并同时完成关键词提取,500页的站15-20分钟全部跑完。第二是数据维度的完整性——它不仅告诉你每个页面有什么关键词,还同时告诉你这个页面的HTTP状态码、标题标签、meta description、内部链接数、外部链接数、页面大小、加载速度。你可以在一个界面里同时看到"这个页面覆盖了哪些关键词"和"这个页面的SEO基础状况如何",不用在两个工具之间切换。

但Screaming Frog的中文分词能力不如爱站。它内置的是通用的Unicode分词规则,对中文复合词的识别精度偏低——"真皮沙发"可能被切成"真皮""沙""发"三个词。而且Screaming Frog没有任何搜索引擎排名数据,它只能告诉你页面里有什么词,不能告诉你这些词有没有搜索量、有没有人在搜。

价格方面:免费版限制500个URL,付费版£199/年(约¥1800/年),买一份全团队共用。

3 - 关键词提取的两条不同技术路线页面有什么词和用户搜什么词给了同样的URL一个返回87个词一个返回27个两种产出的差距不在精度而在底层逻辑完全不同 - UC建站系统

四款工具七维对比

对比维度5118爱站Screaming Frog自建脚本
数据来源搜索排名库+页内词频页内词频页内词频+SEO审计页内词频+任意数据源
批量能力✅ 批量查排名❌ 单页逐个✅ 全站自动爬✅ 无限定制
中文分词精度★★★★★★★★★★★★★☆★★★★★(用jieba)
搜索量数据⚠️ 需接入第三方
竞品对比✅ 内置❌ 需手动⚠️ 需导出后对比⚠️ 需自己写逻辑
价格¥199-499/月免费+¥99/月£199/年免费

四、Python自建脚本:jieba分词 + TF-IDF,30行代码批量跑100个页面

如果你有编程基础且需要高度定制化的关键词提取逻辑,Python + jieba是中文关键词提取的标配组合。jieba是目前最成熟的中文分词Python库,内置了TF-IDF和TextRank两种关键词提取算法,安装一条pip命令搞定,3行代码就能从一段文本里提取TOP 20关键词。

一个批量处理100个页面的最小可用脚本:

import jieba.analyse, requests, csvfrom bs4 import BeautifulSoupURLS = ['https://competitor1.com/product-a','https://competitor2.com/product-b',# ... 100个URL]with open('keywords.csv', 'w', newline='') as f:writer = csv.writer(f)writer.writerow(['URL', '关键词', 'TF-IDF权重'])for url in URLS:html = requests.get(url, timeout=10).textsoup = BeautifulSoup(html, 'html.parser')# 提取正文(去掉script和style标签)for tag in soup(['script', 'style', 'nav', 'footer']):tag.decompose()text = soup.get_text()# TF-IDF提取TOP 20关键词keywords = jieba.analyse.extract_tags(text, topK=20, withWeight=True)for word, weight in keywords:writer.writerow([url, word, round(weight, 4)])print(f'✅ {url}: {len(keywords)}个关键词')

这个脚本跑100个页面大约3-8分钟(取决于每个页面的加载速度),输出一个CSV文件,在Excel里用数据透视表汇总,能看到竞品之间关键词重叠和差异的全貌。自建脚本的灵活度是所有方案里最高的——你可以自定义分词词典(加入行业术语)、调整TF-IDF的权重策略(给title里的词加权)、接入百度/Google API补充搜索量数据、甚至把提取结果自动生成词云图片。代价是你需要写代码和维护脚本。

自建脚本的三个注意事项

1. 停用词过滤。 jieba默认不去除停用词,"的""了""是""在"这些虚词也会被当成关键词输出。需要加载一份中文停用词表(网上有现成的),在extract_tags之前先把停用词过滤掉。

2. 自定义词典。 行业术语如"真皮沙发""纳米涂层""变频压缩机"如果不在jieba默认词典里,可能被错误切分。准备一份行业术语词典文件,在脚本开头用jieba.load_userdict('industry_words.txt')加载。

3. 标题和正文的权重分离。 TF-IDF默认把全文当一段文本处理,不会区分title标签和正文内容。实际SEO中title里的词权重远高于正文。可以在脚本里单独提取title标签文本,给title里的词乘以1.5-2.0的权重系数。

五、选型速查:你的需求落在哪个区间

你的场景推荐方案理由
想知道竞品页面覆盖了哪些有搜索量的词5118唯一带搜索量数据的方案,¥199/月值这个钱
检查自己网站每个页面的关键词密度是否达标爱站 + 免费额度中文分词精度最高,每天免费30-50次够用
批量分析自己全站500个页面的关键词+SEO状态Screaming Frog全自动爬+SEO审计+关键词提取一站式
技术团队,需要高度定制化+免费方案Python + jieba灵活度最高,可定制分词词典和权重策略
只是想看看某个页面有哪些词,一次性需求爱站免费版输入URL就行,零学习成本

关键词提取这件事,免费方案和付费方案的差距不在"能不能提取"——爱站免费版和5118都能从页面里把词找出来。差距在于提取出的词有没有搜索量数据支撑。页内词频只能告诉你"页面写了什么",搜索排名数据才能告诉你"用户搜了什么"。如果你的目标是做竞品内容策略分析,每个月花¥199买5118的搜索排名数据,比花三天时间自己用爱站手动分析100个页面要划算得多。如果你的目标只是检查自己网站的关键词密度是否合理、有没有关键词堆砌的问题,爱站免费版完全够用。两条路线的产出不是一个量级,但对的需求不一样,选错路线才是真正的浪费。

相关推荐
在线客服
👇找客服拿折扣
QQ咨询&售后
在线时间
11:00 ~ 5:30
QQ:3155555535
👇联系QQ
👇联系WX
首页 程序 帮助 登录