上个月一个做了半年的英文站,新发了40篇内容,有两周过去了GSC里一查,26篇状态是"已发现-未收录",剩下14篇干脆连"发现"都没有。站长跑来问是不是域名被惩罚了,一排查——robots没拦、sitemap也提交了、内容也不是AI灌水,问题出在哪儿?出在他以为sitemap提交了就万事大吉,实际上从"Google发现URL"到"真正把页面收进索引库",中间至少隔着三四道坎,每道坎都可能导致页面卡在半路。
Google收录一条URL要经过四道门,每道都可能卡住
| 1 | 发现 — Google要知道这个URL存在,通过sitemap、外链或主动提交 |
| 2 | 抓取 — Googlebot实际访问页面,受抓取预算和服务器响应速度限制 |
| 3 | 解析评估 — 判断内容是否原创、有价值、值得收录,重复/低质直接淘汰 |
| 4 | 索引入库 — 最终进入Google索引库,才能在搜索结果中出现 |
这四道门里,大多数人只在第一道门口使劲——拼命提交sitemap、反复点"请求编入索引"。但后面三道门不开,前面再努力也是白搭。下面把这四道门挨个拆开,每道门讲清楚卡住的原因和对应的解决方式。
一、第一道门"发现":sitemap提交只是开始,别停在原地
GSC里提交sitemap是最基础的入口,但你得搞清楚它提交的是什么——是一个URL列表,不是收录申请。Google拿到sitemap后会把里面的URL放进待抓取队列,至于什么时候抓、抓不抓得到,sitemap管不了。
sitemap提交有三个常见问题值得注意。第一是sitemap里塞了不该塞的URL——404页面、被canonical到别的URL的页面、加了noindex的页面。Google爬虫拿到sitemap一看全是垃圾链接,下次就对你这sitemap不上心了。第二是sitemap太大,单个sitemap文件不能超过50MB或5万条URL,超过要拆分成sitemap index。第三是sitemap没更新,发了新页面不更新sitemap,Google根本不知道有新东西。
sitemap提交的几个实操细节

· sitemap地址放到robots.txt里,Google爬虫每次抓网站时都能自动发现
· WordPress站用Rank Math或Yoast自动生成动态sitemap,发文章即更新
· GSC提交sitemap后观察"已发现URL数"和"已收录URL数"的差值,差值过大说明卡在第二道门
· 多站点站群场景,每个站独立提交各自的sitemap,不要混在一起
sitemap是发现环节的基础操作,但它解决不了"Google知道了但就是不抓"的问题。那才是真正的瓶颈。
二、第二道门"抓取":蜘蛛来不来,取决于你的站值不值得它花时间
Google给每个站分配了一个隐形的抓取预算(crawl budget)——每天大概会抓你多少个页面。这个预算和你的站权重、更新频率、服务器响应速度直接相关。新站或小站的抓取预算少得可怜,可能一天只抓几个页面,你发了100篇内容,蜘蛛一天只能消化几篇,后面的排队排到天荒地老。
有几个操作会严重浪费你的抓取预算:一是站内大量低质页面(标签页、作者存档页、搜索参数页)被收录了,蜘蛛的时间都耗在这些页面上;二是服务器响应慢,蜘蛛来一次等3秒,下次就不爱来了;三是大量301重定向或404页面占用了爬虫配额。
| 抓取预算浪费场景 | 具体表现 | 解决方式 |
|---|---|---|
| 低质页面被索引 | 标签页、搜索页、分页参数页大量出现在索引中 | robots.txt禁止抓取,或用noindex标签排除 |
| 服务器响应慢 | GSC抓取统计中平均响应时间超过500ms | 升级服务器、开缓存、用CDN |
| 302/404连环跳 | 旧链接301到新链接,新链接又跳走了 | 检查重定向链,最多一次跳转到位 |
| 大量重复内容 | 多URL访问同一内容,没设canonical | 用canonical标签指定主URL |
提抓取预算没有捷径,最有效的方式是把内容质量提上去——高质量页面越多,Google对站的信任度越高,预算自然增加。短期要加速的话,可以用GSC的URL Inspection Tool手动请求抓取单个URL,绕过排队直接让蜘蛛来。但这个功能每天有配额(大约10-15条),不适合大批量操作。
三、URL Inspection手动提交:最直接但最有限的方式
这是大多数人最熟悉的方式——打开GSC,顶部搜索框输入URL,回车,点"请求编入索引"。操作简单直观,但有几个限制你得心里有数。
每天的提交上限大约10-15条,超出后GSC会提示配额已用完。而且这个"请求编入索引"并不是按了就立刻收录,它只是告诉Google"这页面可以来看看",Google仍然要经过抓取→解析→评估→索引的全流程。有些页面提交后几分钟就收录了,有些要等几天,取决于页面质量和站权重。
URL Inspection的适用场景
· 刚发了一篇重点文章,想让它尽快被收录 → 提交
· 页面内容做了大幅更新,想让Google重新抓取 → 提交
· 修复了技术问题(noindex误标、robots误拦),通知Google重抓 → 提交
· 几十上百个新页面需要提交 → 别用这个,用Indexing API
GSC还有一个URL Inspection API,可以批量查询URL的收录状态(每天2000条配额),但注意:这个API只能查状态,不能提交收录。很多新手搞混了,以为调用这个API就能批量提交,结果跑了两天发现收录率一点没变。
四、Google Indexing API:批量提交的真正通道
这是Google官方提供的批量提交收录的API接口,专门为JobPosting(招聘)和BroadcastEvent(直播活动)类页面设计。虽然Google官方文档说Indexing API只能用于这两类内容,但实际上绝大多数类型的页面都可以通过它提交,而且Google目前并没有严格限制使用范围。
Indexing API的核心优势是速度快、可批量。单次请求可以提交一条URL,通过脚本循环调用可以实现批量提交。每天的配额是200条(免费),如果需要更多可以申请提额。和手动点"请求编入索引"不同,Indexing API提交的URL通常会进入一个更优先的抓取队列。
配置Indexing API需要几个步骤:在Google Cloud Console创建项目→启用Indexing API→创建服务账号→下载JSON密钥→在Search Console里把服务账号邮箱添加为网站所有者。听起来复杂,实际操作一遍大概半小时能搞定。
# 用curl提交一条URL到Google Indexing APIcurl -X POST "https://indexing.googleapis.com/v3/urlNotifications:publish" -H "Authorization: Bearer $(gcloud auth print-access-token)" -H "Content-Type: application/json" -d '{"url": "https://你的域名.com/新页面/","type": "URL_UPDATED"}' 如果你嫌手动配置麻烦,GitHub上有一个开源工具google-indexing-script,基于TypeScript开发,配置好服务账号JSON后可以直接批量提交URL列表,还带结果验证和重试机制。对于需要批量提交几十上百个页面的场景,比自己写脚本省不少时间。
Indexing API 适合谁
站群运营者每天发几十篇内容,需要批量提交;做过页面改版需要通知Google重抓;API提交比手动快3-5倍。
Indexing API 不适合谁
只有个位数的页面需要提交,手动点几下就完事了;网站内容质量差,提交了也过不了评估关;期望提交就秒收——API只加速发现和抓取,收录还是要靠内容质量。
五、外链和内链:让Google自己找过来,比提交更管用

Google爬虫的日常工作方式不是守在你的sitemap前面刷新——它是在整个互联网上顺着链接爬来爬去。一个新页面如果能被已经被收录的页面链接到,Google爬虫会自然地沿着链接爬过来。这种"自然发现"的收录效率往往比主动提交更高。
实操层面,有几件事可以做。新页面发布后,在站内已有收录的页面里加内链指向新页面,比如在相关内容底部加"推荐阅读"模块。站内面包屑导航和内链结构要清晰,确保从首页出发最多3次点击能到达任何页面。站外方面,在社交媒体(Twitter/X、LinkedIn)发帖带链接,Google会抓取这些平台的新内容。如果有预算,在高质量外链页面加链接效果更好,但要确保是相关行业的自然链接。
内链策略的几个实操点
· 新文章发布后,找3-5篇已有的相关文章,在正文中自然插入链接
· 不要所有新页面都从首页链过去,首页链接权重最高但位置有限
· 列表页、分类页是天然的"链接分发中心",新内容优先从这些页面链出去
· WordPress用Related Posts插件自动生成相关文章推荐,既方便用户又帮蜘蛛导航
外链的作用不只是收录——高质量外链传递的权重会提升整个站的抓取预算,形成正向循环。但这属于SEO的长线投入,短期内对收录加速帮助有限。
六、四种提交方式怎么选:按页面量和紧急程度搭配
| 提交方式 | 适合场景 | 配额/限制 | 收录速度 |
|---|---|---|---|
| Sitemap | 全站基础配置,长期运行 | 单文件≤5万URL或50MB | 慢 取决于抓取预算 |
| URL Inspection手动提交 | 单篇重点内容、修复后重抓 | 约10-15条/天 | 较快 几分钟到几小时 |
| Indexing API | 批量新页面、站群运营 | 200条/天(免费) | 快 通常24小时内 |
| 外链/内链自然发现 | 长期SEO策略,所有页面 | 无上限 | 稳定 持续收录 |
实操搭配建议:新站刚上线,sitemap是必须的,再手动提交首页和几个核心栏目页。日常运营中,每篇新文章发完后用Indexing API提交,同时在站内做内链。遇到重要页面改版或修复技术问题,用URL Inspection手动请求重抓。
七、提交了还是没收录?三个常见卡点排查
很多人提交了URL,状态显示"已抓取-未收录",这说明蜘蛛来过了,看了你的页面,但决定不收。问题不在提交环节,在页面本身。
卡点1:noindex标签
检查页面源代码中是否有 <meta name="robots" content="noindex">,或者HTTP响应头里有 X-Robots-Tag: noindex。WordPress后台"设置→阅读"里如果勾了"建议搜索引擎不收录",全站都加noindex。
卡点2:canonical指错了
canonical标签指向了另一个URL,Google会收录canonical指向的那个而不是你提交的这个。GSC里URL Inspection工具会明确告诉你"Google选择了另一个canonical URL"。
卡点3:内容质量不够
这是最常被忽略的原因。如果页面内容太薄(少于300字)、大量复制粘贴、或者和站内已有页面高度重复,Google评估后认为"不值得收录"。提交再多也没用,得从内容本身入手。
GSC的URL Inspection工具会告诉你具体原因——"已抓取-未收录"下面的说明会写是noindex、canonical问题还是质量问题。很多站长不看这个说明,反复点"请求编入索引",结果自然是一样的。
Google不收录的排查顺序
第一步:GSC → URL Inspection → 输入URL → 看状态。如果"未发现"→ 先检查sitemap有没有这个URL,再检查站内有没有内链指向它。
第二步:如果"已发现-未抓取"→ 检查robots.txt有没有误拦,服务器响应是否正常。
第三步:如果"已抓取-未收录"→ 检查noindex、canonical,再看页面内容质量和字数。
第四步:前三步都没问题但就是不收 → 站权重太低或内容同质化严重,需要从站的整体质量和内容差异化入手,不是提交层面的问题。
八、站群场景下的收录提交,手工操作确实扛不住
如果你是运营多个站的情况,每个站每天发3-5篇内容,一天要处理几十个URL的提交。每个站分别登录GSC、分别手动提交、分别排查收录状态——这工作量想想就头疼。
这时候用系统化方案就很有必要了。UC建站系统的做法是把收录提交集成到内容发布流程里:文章在后台写完发布后,系统自动生成并更新sitemap,同时通过Indexing API批量提交新URL。多站场景下,在统一看板里能看到每个站的收录状态——哪些URL已收录、哪些卡在"已发现未收录"、哪些需要排查noindex或canonical问题。不用一个站一个站登录GSC去查。
还有一个容易被忽视的好处:独立部署的站群,每个站有自己的IP和服务器环境,Google对每个站的抓取预算是独立的。不像共享服务器上挤了几十个站,蜘蛛来一趟要面对几十个域名的请求队列。独立部署+系统化提交,收录效率能拉开明显差距。
说到底,Google收录这件事的底层逻辑没变过:提交只是敲门砖,收录看的是内容质量+站权重+技术配置。把提交方式搞清楚、配置好,它能帮你把本该收录的页面加速收录。但如果页面本身质量不行,提交再多也是白费力气。先把内容做好,再把提交通道打通,这个顺序不能反。
