一个做本地装修站群的朋友跟我算了笔账:20个城市站,每个站铺200篇文章,总共要4000个关键词。他用5118的词根扩展功能,输入"XX装修多少钱一平",把20个城市名替换进去,捣鼓了三天,凑出来大概3200个词。发了一个月,收录率不到15%,有流量的站不到5个。
后来他换了种玩法:用AI先采集百度下拉词,再对每个下拉词递归挖两层相关搜索,最后让大模型按"需求类型+地域+人群"做语义分类。同一批城市站,词库从3200膨胀到17万,筛完去重还有11万可用词。收录率直接拉到40%以上,三个站上了首页。问题出在哪?不是工具不行,是词库的"生长方式"从根本上错了。
百万词库搭建的四层递进逻辑
| 1 | 采集层——不止下拉词,相关搜索、竞价词、竞品词、问题词、地域词,六个数据源一起抓,一个核心词出200-500个种子词 |
| 2 | 递归扩展层——每个种子词作为新种子再挖一轮,三轮递归后词库膨胀50-100倍,且每个词都有真实搜索量 |
| 3 | AI分类去重层——语义去重(不是字符串去重),按意图类型、地域、人群自动分桶,给20个站做差异化分配 |
| 4 | 分配调度层——词到站、词到页面、词到内容模板的自动映射,站间关键词不撞车,内部竞争为0 |
一、同样一个核心词,不同挖法的产出量差了一个数量级
大部分站群操作者的关键词来源只有两个渠道:5118词根扩展 + 百度下拉框手动复制。这两种方式产出的词量天花板很低——一个核心词扩展出来大概200-500个词,去掉重复和无效词,剩300个左右。

但如果你把数据源从两个扩展到六个,差距就出来了。除了百度下拉框和5118词根扩展,还有四个来源经常被忽略:百度相关搜索(搜索结果页底部的10个词,每个都能继续展开)、百度竞价后台关键词规划师(词量极大且有搜索量数据)、竞品站点的百度流量词(爱站/5118反查竞品域名,直接扒人家的词库)、知乎/小红书/抖音的问题词(用户真实提问,长尾度高且竞争小)。
百度下拉框
一个核心词出10-15个,适合做种子词的第一层。优点是完全真实搜索,缺点是数量太少。
百度相关搜索
每个搜索结果页底部有10个词,每个词再搜一次又有10个。两层就能出100+词。
竞价规划师
有搜索量、有竞争度、有出价参考,是评估词价值的最佳数据源。一个核心词能扩展出1000+。
竞品域名反查
爱站/5118查竞品有排名的词,等于直接拿到了别人验证过的词库,效率最高。
社交平台问题词
知乎、小红书上的用户提问天然长尾,竞争度低,转化率高。一个话题能出几十个精准问题词。
5118词根扩展
老牌工具,适合做批量词根拆分+地域拼接。一个核心词用词根模式能拼出500-2000个。
六个数据源一起开,一个核心词从原来的300个种子词直接涨到3000-5000个。这是第一层差距。
二、递归扩展的本质不是"多挖一层",而是让每个词都成为新种子
第一层采集完成之后,绝大多数人的做法是:去重、分类、直接用了。这就等于只挖了一层,后面99%的增量全丢了。
递归扩展的逻辑很简单但很暴力:把第一层采集到的每一个词,都当成新的"核心词",重新走一遍六个数据源的采集流程。
举个例子:"深圳装修多少钱一平"是第一层种子词。第二层:搜这个词的下拉框得到"深圳装修多少钱一平2025""深圳装修全包多少钱一平""深圳老房翻新多少钱一平"。第三层:把"深圳老房翻新多少钱一平"作为种子词再搜,得到"深圳60平老房翻新要多少钱""深圳老房翻新装修公司哪家好""深圳老房翻新预算清单"。每一层都在不断细化和拓展语义方向。
实际操作中,递归层数不是越多越好。经验数据是:三层递归是最佳拐点。第一层出3000-5000个,第二层膨胀到3-5万个,第三层到15-20万个。第四层开始,新增词中重复率和无效词比例急剧上升(超过60%),边际收益骤降。
三层递归的产出规律:假设一个站群覆盖20个核心词方向。第一层:20核心词 × 6数据源 = 约4000种子词。第二层:4000种子词 × 平均每词出8个新词 = 32000词。第三层:32000 × 平均出6个 = 约19万词。去重后可用词库10-12万。相比只采一层下拉词的3000个词,差出了30-40倍。
递归过程有一个关键控制点:每层必须做语义去重,不能等三层跑完再统一去重。因为第三层产出的词如果和第二层高度语义重复,等于白跑。正确的做法是:每层采集完成后立即做语义去重,只把不重复的词送入下一层作为种子。
三、AI去重和传统字符串去重的本质区别:一个看"长什么样",一个看"在说什么"
递归产出的20万词里,至少有40%-50%是语义重复的。比如"深圳装修报价明细表""深圳装修费用清单""深圳装修预算表2025",字符串去重会认为这是三个不同的词,但语义上去掉两个就够了。如果三个都保留,就等于三个站发了内容高度雷同的文章,被搜索引擎判定为重复内容。
| 去重方式 | 判断标准 | 效果 | 适用规模 |
|---|---|---|---|
| 字符串完全匹配 | 两个词一模一样才去重 | 去重率不到5%,大量语义重复词漏网 | 任何规模 |
| 编辑距离去重 | 两个词相似度超过阈值就去重 | 去重率约15%-20%,容易误杀 | 10万以内 |
| 词根拆分去重 | 拆成核心词+修饰词,看核心词是否相同 | 去重率约30%,但仍会漏掉同义不同词根的情况 | 50万以内 |
| AI语义去重 | 用大模型判断两个词的搜索意图是否相同 | 去重率40%-55%,准确率95%以上 | 百万级(分批处理) |
AI语义去重的具体做法:把词库分批(每批500-1000个词)扔给大模型,让它按搜索意图分组。同一个意图组里保留搜索量最大或最长尾的那个词,其余标记为重复。处理完一轮后,跨组再做一次交叉检查,防止不同组的词存在隐性语义重复。
AI去重的Prompt示例:
"以下是一组SEO关键词,请按用户搜索意图将它们分组。同一个意图组内的词只保留最有代表性的1-2个。判断标准:如果两个词搜出来的结果应该是同一类内容,就归为一组。输出格式:{组名:保留词,删除词列表}"
百万级词库用AI去重,成本大概在几十到一百多块钱(用GPT-4o mini或Claude Haiku级别的模型即可,不需要顶级模型)。相比省下来的内容生产成本和避免的站内重复惩罚,这个投入完全可以忽略。
四、词库分类不是贴标签,是做"站-词-内容"的三角映射
去重之后的10万+词库,如果不做分类就直接随机分配给20个站,会出现严重的内耗:两个站拿到了同一个意图方向的词,写出来的文章大同小异,搜索引擎判断为重复内容,两个站都拿不到排名。
AI分类要做的是三件事同时完成:
按意图分类
6类
信息型/导航型/交易型/对比型/问题型/本地型
按地域分类
20+城
城市名自动识别,分配给对应城市站
按难度分层
3级

低竞争长尾/中竞争腰部/高竞争核心词
分类完成后,每个站拿到的是一组意图方向不同、地域匹配、难度分层的关键词包。比如"北京装修报价"和"深圳装修报价"两个词,意图相同但地域不同,分别分给北京站和深圳站。"装修报价明细表"和"装修公司怎么选"意图不同,可以分给同一个站的不同栏目。
内耗检测:分类完成后必须跑一遍"站间交叉检查"——用AI逐对比较两个站的关键词包,看有没有意图重叠超过15%的。如果北京站和上海站的关键词意图重叠超过15%,说明分类颗粒度不够细,需要再拆一层。目标是把站间意图重叠控制在10%以内。
五、六个核心数据源怎么用,从免费到付费的实操方案
很多人听到"六个数据源"就觉得要买一堆付费工具。实际上免费方案就能跑通80%的流程,剩下20%靠一两个付费工具补上精度。
| 数据源 | 免费方案 | 付费升级 | 单核心词产出 |
|---|---|---|---|
| 百度下拉框 | Python requests模拟,免费无限量 | 无需付费 | 10-15个 |
| 百度相关搜索 | Python爬虫,需处理反爬 | 5118会员可批量导出 | 50-200个(含递归) |
| 竞价规划师 | 需开通百度推广账号(有门槛) | 5118/爱站VIP导出 | 500-2000个 |
| 竞品域名反查 | 爱站/5118免费版可查前50个词 | 5118会员查全部 | 200-3000个 |
| 社交平台问题词 | 知乎/小红书手动搜索+AI提取 | 无需付费 | 50-200个 |
| 5118词根扩展 | 免费版每日有限额 | 专业版约300元/月 | 500-2000个 |
最省钱的组合:百度下拉框(免费)+ 百度相关搜索(免费)+ 知乎小红书手动采集(免费)+ 5118基础版(约99元/月)+ Claude/GPT API做去重分类(按量付费,几十元/月)。月成本控制在200元以内,一个站群项目周期跑下来,10万+词库的采集+去重+分类全搞定。
如果想做得更省事,可以买5118的专业版(约300元/月),把下拉词、相关搜索、竞品反查、竞价词四个数据源全包了,再搭配免费的问题词采集。API调用成本另算,但省下来的时间远比300块钱值钱。
六、用Python加AI跑通百万词库的完整流程,跑一次管半年
手工一个个采词不现实,必须上脚本。整个流程可以拆成四个Python脚本串联自动化:
# 脚本1:多数据源采集(百度下拉+相关搜索+5118API)# 输入:核心词列表 keywords.txt# 输出:raw_keywords.csv(原始词库,含来源标注)# 脚本2:递归扩展(3层)# 输入:raw_keywords.csv → 输出:expanded_keywords.csv# 每层扩展后调用AI语义去重,去重后的词作为下一层种子# 脚本3:AI语义去重+意图分类# 输入:expanded_keywords.csv → 输出:dedup_classified.csv# 调用GPT/Claude API,每批1000个词# 脚本4:站群分配映射# 输入:dedup_classified.csv + 站点列表 sites.csv# 输出:site_keywords/ 目录下每个站一个CSV方案A:直接用大模型API(推荐)
1000个词一批,用Claude Haiku或GPT-4o mini处理。单批成本约0.01-0.03美元。10万词约100批,总成本1-3美元。分类精度95%+。
方案B:本地部署开源模型
Ollama跑Qwen/DeepSeek 7B模型,本地免费无限量。需8G+显存,精度85%-90%。
方案C:传统NLP + 规则引擎
jieba分词 + TF-IDF + 余弦相似度去重,正则做地域提取和意图分类。完全免费,精度低于AI方案。
七、词库分配到站点时最容易踩的三个坑
坑1:两个站分到了同一个核心意图方向
北京站和上海站都分到"装修报价"方向的词,虽然地域不同,但文章结构雷同,百度只收录一个。解法:分配时确保每个站的核心意图有差异,北京站主攻"报价+流程",上海站主攻"材料+设计"。
坑2:新站一上来就分配高竞争核心词
新站权重低,分到"装修多少钱一平"这种高竞争词写了也排不上去。正确做法:新站前3个月只分配低竞争长尾词,收录率上来后再逐步加入腰部词。
坑3:同一个站分配了太多方向,内容杂乱
一个站同时做"装修报价""装修设计""建材选购""装修风水",搜索引擎无法判断站点主题,权重分散。每个站聚焦2-3个紧密关联的意图方向,其他方向交给别的站。
分配还有一个时间维度要考虑:词库不是一次性全部分完的。10万词的词库,一个20站的站群如果一次性全分配,每个站5000个词,按每天发5篇的速度要发将近三年。实际做法是:先分前30天的量(每站150个词),等第一批内容被收录后,根据收录数据调整第二批的分配策略——收录好的站多给词,收录差的站排查原因。
八、系统化管词库和手工折腾的效率差在哪
前面的流程看起来很清晰,但真正自己跑一遍就知道:四个Python脚本、六个数据源、三个AI处理环节,再加上定期更新词库、监控站间重叠、调整分配策略——这些事如果每次都要手工跑脚本、手工检查CSV,一个月下来光维护词库就要耗掉大半个星期。
| 环节 | 手工/脚本方式 | 系统化方式 |
|---|---|---|
| 关键词采集 | 手动跑Python脚本,逐个数据源切换 | 定时任务自动采集,新词自动入库 |
| 递归扩展 | 手动设置递归层数,分批处理 | 自动递归+自动去重,达到阈值停止 |
| AI去重分类 | 手工调API,分批提交,检查结果 | 一键触发,自动分批+自动校验 |
| 站群分配 | 手工跑分配脚本,手动检查重叠 | 自动分配+重叠预警+可视化看板 |
| 词库更新 | 想起来才更新,周期不固定 | 每周自动增量更新,新词自动分类分配 |
系统化的核心价值不是"能不能做",而是"能不能持续做"。手工作坊式的一次性采集,词库是死的——三个月后搜索趋势变了、新词出来了、竞品换了打法,你的词库还停在三个月前。系统化方案能做到每周自动增量更新,新的下拉词、新的相关搜索、新的竞品词自动汇入词库,AI自动分类分配到对应站点。词库从"一次性的静态资产"变成"持续生长的活水"。
用UC建站系统做站群词库管理,整个流程是内嵌在内容中台里的。核心词录入后,系统自动走完采集→递归扩展→AI去重→意图分类→站群分配的全链路。多站看板上能直接看到每个站当前分配了多少词、已发布多少篇、收录率多少、哪些词方向还有空缺。对比自己搭四个脚本再手工维护,省下来的时间够再开一个站群项目了。
九、百万词库的成本账:到底花多少钱能跑起来
最后算一笔实在的账。搭建一个覆盖20个城市、10万+可用词的站群词库,三种方案的成本如下:
| 方案 | 工具成本 | AI API成本 | 时间投入 | 月总成本 |
|---|---|---|---|---|
| 极简方案 | 0元(全免费工具+Python) | 0元(本地模型或规则引擎) | 约40小时/月 | 0元(时间成本另算) |
| 标准方案 | 5118基础版99元/月 | GPT-4o mini约50元/月 | 约15小时/月 | 约150元/月 |
| 专业方案 | 5118专业版300元/月 | Claude Haiku约80元/月 | 约5小时/月 | 约380元/月 |
标准方案150元/月,专业方案380元/月。对比站群带来的流量和转化收益,这个成本基本可以忽略。真正贵的是时间——极简方案虽然不花钱,但每月40小时的维护时间,按最低时薪算都远超380元了。如果不是纯粹为了学习技术,标准方案起步是最合理的。
另外有一个隐藏成本经常被忽略:词库维护的持续性。一次性花150元搭好词库是一回事,每月花150元持续更新是另一回事。很多人只算了第一笔,没算后面的。实际上词库维护是一个长期开销,搜索趋势每月都在变,如果只采一次就放着不管,三个月后至少30%的词已经过时了。所以预算规划的时候,至少按6个月来做,标准方案就是900元,专业方案就是2280元。
说穿了:百万词库这件事,技术门槛不高——Python爬虫+AI API调用,技术栈很成熟。真正的门槛在于有没有持续维护的意识和系统化的管理工具。一次性搞完就丢在那不管的"百万词库",不如一个每月更新的"万级活词库"。
