Google Search Console每天收到超过120万次robots.txt语法错误的报告,其中路径不以/开头、大小写写错、文件放在子目录下占了前三位。一个只有5行代码的文本文件,写错了轻则整站不被收录,重则把不该公开的后台路径暴露给所有搜索引擎。好消息是2026年你不需要手写任何一行robots.txt,在线生成器已经做到了选模板、勾选项、点生成三步出文件
而且2026年的robots.txt多了一个绕不开的维度——AI爬虫。GPTBot、ClaudeBot、PerplexityBot、CCBot等14+种AI训练爬虫在日夜不停地抓取你的网站内容喂给大模型,而传统robots.txt教程里几乎不提它们。下面从生成器到规则到AI屏蔽,完整拆开。
robots.txt不是安全工具,是君子协定。Googlebot和百度蜘蛛会遵守,但恶意爬虫完全可以无视它。真正的敏感内容(管理后台、API接口、用户数据)需要靠登录鉴权和服务器端访问控制来保护,robots.txt只负责告诉守规矩的爬虫"这里别来"。
一、robots.txt五条核心语法,一条写错全盘皆输
先过一遍语法,因为即使用生成器,你也需要理解它生成了什么、为什么这么写。
| 指令 | 作用 | 格式要求 | 谁遵守 |
|---|---|---|---|
| User-agent | 指定规则适用的爬虫,*表示所有 | 严格区分大小写:Baiduspider不能写成baiduspider | 所有爬虫 |
| Disallow | 禁止爬取的路径(前缀匹配) | 路径必须以/开头;Disallow: / 表示禁止全站 | 所有爬虫 |
| Allow | 在Disallow范围内允许特定子路径 | 只在配合Disallow时才有意义 | Google、Bing |
| Sitemap | 声明站点地图的完整URL | 必须写完整的https://域名/sitemap.xml | Google、Bing、百度 |
| Crawl-delay | 爬虫请求间隔(秒),防止爬虫打爆服务器 | 数字,例如Crawl-delay: 2 | 百度、Bing;Google忽略 |
最常见的六个手写错误,生成器能帮你全部避开:
· 路径忘了写开头的 /——写成 Disallow: admin/ 而不是 Disallow: /admin/
· User-agent 大小写写错——百度蜘蛛是 Baiduspider,写成了 baiduspider 或 BaiduSpider,规则直接失效

· 文件没放在网站根目录——放到了/wp-content/下面,爬虫根本找不到
· 文件编码不是UTF-8无BOM——带了BOM头导致第一行User-agent解析失败
· 在robots.txt里写了 Noindex 指令——Noindex应该放在HTML的meta标签里,robots.txt不支持
· 文件超过500KB——Google直接忽略超过500KB的robots.txt
二、五款在线生成器横向对比
| 生成器 | AI爬虫预设 | 场景模板 | 实时预览 | 特色 | 最适合 |
|---|---|---|---|---|---|
| Wokeey | 14+种AI爬虫一键开关 | Website/Blog/Store/SaaS 四模板 | 彩色语法高亮+行号 | AI屏蔽最全,模板最丰富 | 需要AI爬虫屏蔽+场景模板的 |
| ZeroTool | 部分AI爬虫 | 5种中文场景预设 | 实时预览 | 中文场景最接地气 | 国内网站+百度蜘蛛规则 |
| SEOStudio | 无专门AI预设 | 无模板 | 预览+直接下载 | 操作极简,三步完成 | 只需要基础规则的简单网站 |
| Serverless Tools | GPTBot/CCBot/ChatGPT预设 | 有预设规则列表 | 可视化构建器 | 浏览器本地处理,不上传数据 | 注重隐私安全的 |
| Toolsv | 无专门AI预设 | 无模板 | 可视化规则编辑器 | 界面最直观,勾选式操作 | 完全零基础用户 |
三、四种网站类型的robots.txt模板
WordPress/博客站
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-json/
Disallow: /?s=
Disallow: /*?replytocom=
Allow: /wp-admin/admin-ajax.php
Sitemap: https://你的域名.com/sitemap.xml
电商站
User-agent: *
Disallow: /cart/
Disallow: /checkout/
Disallow: /my-account/
Disallow: /wishlist/
Disallow: /*?sort=
Disallow: /*?filter=
Allow: /product/
Allow: /category/
Sitemap: https://你的域名.com/sitemap.xml
SaaS/Web应用
User-agent: *
Disallow: /dashboard/
Disallow: /admin/
Disallow: /api/
Disallow: /app/
Disallow: /internal/
Allow: /pricing/
Allow: /blog/
Allow: /features/
Sitemap: https://你的域名.com/sitemap.xml
百度SEO专用(允许百度、限制其他)
User-agent: Baiduspider
Disallow:
Crawl-delay: 1
User-agent: *
Disallow: /
Sitemap: https://你的域名.com/sitemap.xml
四、2026年必须加上的AI爬虫屏蔽规则
2026年robots.txt最显著的变化是AI爬虫成了独立的管理维度。过去robots.txt只管搜索引擎爬虫(Googlebot、Bingbot、Baiduspider),现在多了十几个AI训练爬虫,它们不给你带流量,只从你的网站取数据去训练模型。
要不要屏蔽AI爬虫取决于你的目的:如果你的网站希望内容出现在ChatGPT、Claude、Perplexity的搜索结果里,就应该放行;如果你不希望内容被用于训练AI模型,就应该屏蔽。这是两个不同的决策,可以分开设置——比如允许搜索型AI爬虫(给答案时引用你)但屏蔽训练型AI爬虫(拿你的数据训练模型)。
| 爬虫名 | 所属 | 用途 | 是否遵守robots.txt | 建议 |
|---|---|---|---|---|
| GPTBot | OpenAI | 训练GPT模型 | ✓ 遵守 | 不想被训练就屏蔽 |
| OAI-SearchBot | OpenAI | ChatGPT搜索引用 | ✓ 遵守 | 建议放行,带来AI搜索流量 |
| ClaudeBot | Anthropic | 训练Claude模型 | 部分遵守 | 建议屏蔽,部分遵守不够可靠 |
| PerplexityBot | Perplexity AI | Perplexity搜索 | ✓ 遵守 | 建议放行,AI搜索流量来源 |
| CCBot | Common Crawl | 公开数据集(被AI训练用) | ✓ 遵守 | 不想数据进公开数据集就屏蔽 |
| Google-Extended | Gemini/Bard训练 | ✓ 遵守 | 不想内容进Gemini就屏蔽 | |
| anthropic-ai | Anthropic | Claude训练(旧标识) | 部分遵守 | 和ClaudeBot一起屏蔽 |
| cohere-ai | Cohere | 企业AI训练 | 未知 | 建议屏蔽 |
如果选择屏蔽AI训练爬虫,在robots.txt末尾加上这一段:
# 屏蔽AI训练爬虫
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: cohere-ai
Disallow: /
# 但允许AI搜索引用爬虫(可选)
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
注意:robots.txt对AI爬虫是声明式阻止,守规矩的会遵守,不守规矩的仍然可以绕过。对于确实不想被任何AI爬虫抓取的内容,还需要在服务器层面配合Cloudflare WAF规则或Nginx的IP黑名单做强制拦截。
五、生成后必做的三件事
1. 上传到网站根目录
文件名必须是 robots.txt(全部小写),放在网站根目录。访问 https://你的域名.com/robots.txt 应该直接显示文件内容,HTTP状态码200,Content-Type为text/plain。
2. 用官方工具验证
Google Search Console有内置的robots.txt测试工具,百度站长平台有"robots检测"功能。生成器输出的文件在上传前建议先丢进去跑一遍验证——有时候看起来没问题的规则,解析器会报出隐藏的语法错误。Google的工具还会告诉你具体哪一行有问题以及原因。
3. 不要屏蔽CSS/JS/图片资源

Google需要抓取CSS和JS文件来渲染页面以理解移动端展示效果。如果你在robots.txt里屏蔽了/wp-content/themes/或/assets/目录,Googlebot看到的将是一个没有样式的裸页面,直接影响排名。这也是生成器模板不会屏蔽资源目录的原因——但如果你手动加了Disallow规则,要特别检查这一点。
六、从生成到上线的完整流程
假设你有一个新上线的WordPress博客,需要一份完整的robots.txt:
Step 1:打开Wokeey生成器,选择"Blog/WordPress"模板。自动填入WordPress标准规则(屏蔽/wp-admin/、/wp-includes/等)。
Step 2:在Sitemap栏填入你的站点地图地址,比如 https://你的域名.com/sitemap.xml。
Step 3:如果你不想内容被AI训练,打开AI爬虫屏蔽开关。如果希望内容出现在ChatGPT和Perplexity的搜索结果里,保留OAI-SearchBot和PerplexityBot的Allow规则。
Step 4:复制生成的内容,上传到网站根目录。用FTP或者在服务器上直接 nano /var/www/html/robots.txt 粘贴进去。
Step 5:打开Google Search Console → 设置 → robots.txt测试工具,输入你的域名,提交验证。确认所有Disallow规则都按预期生效。
Step 6:浏览器访问 https://你的域名.com/robots.txt,确认能看到正确内容。
整个过程不超过10分钟,比手写+查语法+排查错误快得多,而且不会出现路径忘加斜杠、User-agent大小写写错这种低级问题。
七、robots.txt和XML Sitemap的关系
robots.txt里声明的Sitemap地址是爬虫发现站点地图的第一条路径。如果你在robots.txt里写了Sitemap地址,Googlebot会在每次抓取robots.txt时同步读取Sitemap中的URL列表。这比在Google Search Console里手动提交Sitemap更可靠——因为Search Console的提交是"告诉Google一次",而robots.txt里的声明是"每次爬都告诉一次"。
一个常被忽略的点:robots.txt里的Sitemap声明可以写多条。如果你的网站有多语言版本(如 sitemap-zh.xml、sitemap-en.xml)或者文章和产品分开管理,可以写多行Sitemap声明,爬虫会逐条处理:
Sitemap: https://你的域名.com/sitemap-post.xml
Sitemap: https://你的域名.com/sitemap-product.xml
Sitemap: https://你的域名.com/sitemap-page.xml
另一个细节:robots.txt里Sitemap的URL必须是完整的绝对路径,不能写相对路径。而且Sitemap文件本身不能被robots.txt屏蔽——如果你Disallow了/sitemap所在的目录,等于告诉爬虫"地图在这里,但你不准看地图",属于自相矛盾。
八、用Cloudflare WAF补齐robots.txt的短板
robots.txt对不守规矩的爬虫来说是一张废纸。对于确实需要强制拦截的AI训练爬虫或恶意爬虫,可以在Cloudflare的WAF规则里直接封User-Agent:
(http.user_agent contains "GPTBot") or
(http.user_agent contains "ClaudeBot") or
(http.user_agent contains "CCBot") or
(http.user_agent contains "cohere-ai")
这样设置后,被命中的爬虫请求会直接返回403 Forbidden,不管它看不看robots.txt。WAF拦截和robots.txt声明并不冲突——robots.txt是礼貌的"请勿入内",WAF是物理的门禁,两者配合使用才完整。
但注意:User-Agent可以伪造。恶意爬虫可以轻松把自己的UA改成Chrome浏览器来绕过WAF规则。所以WAF拦截只能挡住守规矩的AI爬虫和低技术水平的恶意爬虫,无法阻止专业的采集者。真正的反爬需要配合速率限制(Rate Limiting)、JS挑战(JS Challenge)和行为分析等多层防护。
整个过程不超过10分钟,比手写+查语法+排查错误快得多,而且不会出现路径忘加斜杠、User-agent大小写写错这种低级问题。
最后说一句:robots.txt是SEO基础设施里成本最低但出错代价最高的一项。用生成器花5分钟做一份正确的、上传到根目录、在Search Console里验证通过,比你手写一份然后花两周排查"为什么整站不被收录"划算得多。2026年再加上AI爬虫的规则,就是一份完整的、面向当前搜索引擎生态的robots.txt。
