用户登录
个人主页 用户中心 我的订单 添加授权 管理授权
退出登录
用户登录 用户注册
欢迎来到 UC建站系统

Google Search Console每天超过120万次robots.txt语法错误路径不以斜杠开头大小写写错文件放子目录占前三:2026年不需要手写任何一行在线生成器选模板勾选项点生成三步出文件还要堵住GPTBot和ClaudeBot等14种AI爬虫

Google Search Console每天收到超过120万次robots.txt语法错误的报告,其中路径不以/开头、大小写写错、文件放在子目录下占了前三位。一个只有5行代码的文本文件,写错了轻则整站不被收录,重则把不该公开的后台路径暴露给所有搜索引擎。好消息是2026年你不需要手写任何一行robots.txt,在线生成器已经做到了选模板、勾选项、点生成三步出文件

而且2026年的robots.txt多了一个绕不开的维度——AI爬虫。GPTBot、ClaudeBot、PerplexityBot、CCBot等14+种AI训练爬虫在日夜不停地抓取你的网站内容喂给大模型,而传统robots.txt教程里几乎不提它们。下面从生成器到规则到AI屏蔽,完整拆开。

robots.txt不是安全工具,是君子协定。Googlebot和百度蜘蛛会遵守,但恶意爬虫完全可以无视它。真正的敏感内容(管理后台、API接口、用户数据)需要靠登录鉴权和服务器端访问控制来保护,robots.txt只负责告诉守规矩的爬虫"这里别来"。

一、robots.txt五条核心语法,一条写错全盘皆输

先过一遍语法,因为即使用生成器,你也需要理解它生成了什么、为什么这么写。

指令作用格式要求谁遵守
User-agent指定规则适用的爬虫,*表示所有严格区分大小写:Baiduspider不能写成baiduspider所有爬虫
Disallow禁止爬取的路径(前缀匹配)路径必须以/开头;Disallow: / 表示禁止全站所有爬虫
Allow在Disallow范围内允许特定子路径只在配合Disallow时才有意义Google、Bing
Sitemap声明站点地图的完整URL必须写完整的https://域名/sitemap.xmlGoogle、Bing、百度
Crawl-delay爬虫请求间隔(秒),防止爬虫打爆服务器数字,例如Crawl-delay: 2百度、Bing;Google忽略

最常见的六个手写错误,生成器能帮你全部避开:

· 路径忘了写开头的 /——写成 Disallow: admin/ 而不是 Disallow: /admin/

· User-agent 大小写写错——百度蜘蛛是 Baiduspider,写成了 baiduspiderBaiduSpider,规则直接失效

1 - Google Search Console每天超过120万次robots.txt语法错误路径不以斜杠开头大小写写错文件放子目录占前三:2026年不需要手写任何一行在线生成器选模板勾选项点生成三步出文件还要堵住GPTBot和ClaudeBot等14种AI爬虫 - UC建站系统

· 文件没放在网站根目录——放到了/wp-content/下面,爬虫根本找不到

· 文件编码不是UTF-8无BOM——带了BOM头导致第一行User-agent解析失败

· 在robots.txt里写了 Noindex 指令——Noindex应该放在HTML的meta标签里,robots.txt不支持

· 文件超过500KB——Google直接忽略超过500KB的robots.txt

二、五款在线生成器横向对比

生成器AI爬虫预设场景模板实时预览特色最适合
Wokeey14+种AI爬虫一键开关Website/Blog/Store/SaaS 四模板彩色语法高亮+行号AI屏蔽最全,模板最丰富需要AI爬虫屏蔽+场景模板的
ZeroTool部分AI爬虫5种中文场景预设实时预览中文场景最接地气国内网站+百度蜘蛛规则
SEOStudio无专门AI预设无模板预览+直接下载操作极简,三步完成只需要基础规则的简单网站
Serverless ToolsGPTBot/CCBot/ChatGPT预设有预设规则列表可视化构建器浏览器本地处理,不上传数据注重隐私安全的
Toolsv无专门AI预设无模板可视化规则编辑器界面最直观,勾选式操作完全零基础用户

三、四种网站类型的robots.txt模板

WordPress/博客站

User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-json/
Disallow: /?s=
Disallow: /*?replytocom=
Allow: /wp-admin/admin-ajax.php

Sitemap: https://你的域名.com/sitemap.xml

电商站

User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /wishlist/
Disallow: /*?sort=
Disallow: /*?filter=
Allow: /product/
Allow: /category/

Sitemap: https://你的域名.com/sitemap.xml

SaaS/Web应用

User-agent: *
Disallow: /dashboard/
Disallow: /admin/
Disallow: /api/
Disallow: /app/
Disallow: /internal/
Allow: /pricing/
Allow: /blog/
Allow: /features/

Sitemap: https://你的域名.com/sitemap.xml

百度SEO专用(允许百度、限制其他)

User-agent: Baiduspider
Disallow:
Crawl-delay: 1

User-agent: *
Disallow: /

Sitemap: https://你的域名.com/sitemap.xml

四、2026年必须加上的AI爬虫屏蔽规则

2026年robots.txt最显著的变化是AI爬虫成了独立的管理维度。过去robots.txt只管搜索引擎爬虫(Googlebot、Bingbot、Baiduspider),现在多了十几个AI训练爬虫,它们不给你带流量,只从你的网站取数据去训练模型。

要不要屏蔽AI爬虫取决于你的目的:如果你的网站希望内容出现在ChatGPT、Claude、Perplexity的搜索结果里,就应该放行;如果你不希望内容被用于训练AI模型,就应该屏蔽。这是两个不同的决策,可以分开设置——比如允许搜索型AI爬虫(给答案时引用你)但屏蔽训练型AI爬虫(拿你的数据训练模型)。

爬虫名所属用途是否遵守robots.txt建议
GPTBotOpenAI训练GPT模型✓ 遵守不想被训练就屏蔽
OAI-SearchBotOpenAIChatGPT搜索引用✓ 遵守建议放行,带来AI搜索流量
ClaudeBotAnthropic训练Claude模型部分遵守建议屏蔽,部分遵守不够可靠
PerplexityBotPerplexity AIPerplexity搜索✓ 遵守建议放行,AI搜索流量来源
CCBotCommon Crawl公开数据集(被AI训练用)✓ 遵守不想数据进公开数据集就屏蔽
Google-ExtendedGoogleGemini/Bard训练✓ 遵守不想内容进Gemini就屏蔽
anthropic-aiAnthropicClaude训练(旧标识)部分遵守和ClaudeBot一起屏蔽
cohere-aiCohere企业AI训练未知建议屏蔽

如果选择屏蔽AI训练爬虫,在robots.txt末尾加上这一段:

# 屏蔽AI训练爬虫
User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: cohere-ai
Disallow: /

# 但允许AI搜索引用爬虫(可选)
User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

注意:robots.txt对AI爬虫是声明式阻止,守规矩的会遵守,不守规矩的仍然可以绕过。对于确实不想被任何AI爬虫抓取的内容,还需要在服务器层面配合Cloudflare WAF规则或Nginx的IP黑名单做强制拦截。

五、生成后必做的三件事

1. 上传到网站根目录

文件名必须是 robots.txt(全部小写),放在网站根目录。访问 https://你的域名.com/robots.txt 应该直接显示文件内容,HTTP状态码200,Content-Type为text/plain。

2. 用官方工具验证

Google Search Console有内置的robots.txt测试工具,百度站长平台有"robots检测"功能。生成器输出的文件在上传前建议先丢进去跑一遍验证——有时候看起来没问题的规则,解析器会报出隐藏的语法错误。Google的工具还会告诉你具体哪一行有问题以及原因。

3. 不要屏蔽CSS/JS/图片资源

2 - Google Search Console每天超过120万次robots.txt语法错误路径不以斜杠开头大小写写错文件放子目录占前三:2026年不需要手写任何一行在线生成器选模板勾选项点生成三步出文件还要堵住GPTBot和ClaudeBot等14种AI爬虫 - UC建站系统

Google需要抓取CSS和JS文件来渲染页面以理解移动端展示效果。如果你在robots.txt里屏蔽了/wp-content/themes/或/assets/目录,Googlebot看到的将是一个没有样式的裸页面,直接影响排名。这也是生成器模板不会屏蔽资源目录的原因——但如果你手动加了Disallow规则,要特别检查这一点。

六、从生成到上线的完整流程

假设你有一个新上线的WordPress博客,需要一份完整的robots.txt:

Step 1:打开Wokeey生成器,选择"Blog/WordPress"模板。自动填入WordPress标准规则(屏蔽/wp-admin/、/wp-includes/等)。

Step 2:在Sitemap栏填入你的站点地图地址,比如 https://你的域名.com/sitemap.xml

Step 3:如果你不想内容被AI训练,打开AI爬虫屏蔽开关。如果希望内容出现在ChatGPT和Perplexity的搜索结果里,保留OAI-SearchBot和PerplexityBot的Allow规则。

Step 4:复制生成的内容,上传到网站根目录。用FTP或者在服务器上直接 nano /var/www/html/robots.txt 粘贴进去。

Step 5:打开Google Search Console → 设置 → robots.txt测试工具,输入你的域名,提交验证。确认所有Disallow规则都按预期生效。

Step 6:浏览器访问 https://你的域名.com/robots.txt,确认能看到正确内容。

整个过程不超过10分钟,比手写+查语法+排查错误快得多,而且不会出现路径忘加斜杠、User-agent大小写写错这种低级问题。

七、robots.txt和XML Sitemap的关系

robots.txt里声明的Sitemap地址是爬虫发现站点地图的第一条路径。如果你在robots.txt里写了Sitemap地址,Googlebot会在每次抓取robots.txt时同步读取Sitemap中的URL列表。这比在Google Search Console里手动提交Sitemap更可靠——因为Search Console的提交是"告诉Google一次",而robots.txt里的声明是"每次爬都告诉一次"。

一个常被忽略的点:robots.txt里的Sitemap声明可以写多条。如果你的网站有多语言版本(如 sitemap-zh.xml、sitemap-en.xml)或者文章和产品分开管理,可以写多行Sitemap声明,爬虫会逐条处理:

Sitemap: https://你的域名.com/sitemap-post.xml
Sitemap: https://你的域名.com/sitemap-product.xml
Sitemap: https://你的域名.com/sitemap-page.xml

另一个细节:robots.txt里Sitemap的URL必须是完整的绝对路径,不能写相对路径。而且Sitemap文件本身不能被robots.txt屏蔽——如果你Disallow了/sitemap所在的目录,等于告诉爬虫"地图在这里,但你不准看地图",属于自相矛盾。

八、用Cloudflare WAF补齐robots.txt的短板

robots.txt对不守规矩的爬虫来说是一张废纸。对于确实需要强制拦截的AI训练爬虫或恶意爬虫,可以在Cloudflare的WAF规则里直接封User-Agent:

(http.user_agent contains "GPTBot") or
(http.user_agent contains "ClaudeBot") or
(http.user_agent contains "CCBot") or
(http.user_agent contains "cohere-ai")

这样设置后,被命中的爬虫请求会直接返回403 Forbidden,不管它看不看robots.txt。WAF拦截和robots.txt声明并不冲突——robots.txt是礼貌的"请勿入内",WAF是物理的门禁,两者配合使用才完整。

但注意:User-Agent可以伪造。恶意爬虫可以轻松把自己的UA改成Chrome浏览器来绕过WAF规则。所以WAF拦截只能挡住守规矩的AI爬虫和低技术水平的恶意爬虫,无法阻止专业的采集者。真正的反爬需要配合速率限制(Rate Limiting)、JS挑战(JS Challenge)和行为分析等多层防护。

整个过程不超过10分钟,比手写+查语法+排查错误快得多,而且不会出现路径忘加斜杠、User-agent大小写写错这种低级问题。

最后说一句:robots.txt是SEO基础设施里成本最低但出错代价最高的一项。用生成器花5分钟做一份正确的、上传到根目录、在Search Console里验证通过,比你手写一份然后花两周排查"为什么整站不被收录"划算得多。2026年再加上AI爬虫的规则,就是一份完整的、面向当前搜索引擎生态的robots.txt。

相关推荐
在线客服
👇找客服拿折扣
QQ咨询&售后
在线时间
11:00 ~ 5:30
QQ:3155555535
👇联系QQ
👇联系WX
首页 程序 帮助 登录