Robots.txt 检测器

输入任意网站域名,一键解析其 robots.txt:规则数量、User-agent 分组、sitemap 声明,以及 14 个主流 AI 爬虫(GPTBot / ClaudeBot / PerplexityBot / CCBot 等)的抓取权限对照——判断一个站点对搜索引擎和 AI 助手分别开放到什么程度。

怎么读结果:「全站禁止」表示该 AI 爬虫被 Disallow: / 完全拦截;「受通配组约束」表示站点没有为它单独写规则,但 * 组的 Disallow 同样对它生效;robots.txt 返回 404 不代表出问题——按协议默认全站允许抓取。

关于 Robots.txt 与 AI 时代抓取权限

robots.txt 是网站与爬虫之间的协议文件:搜索引擎和 AI 公司的爬虫在抓取你的网站前会先读取它,遵守其中 User-agent / Disallow / Allow 规则。写得好的 robots.txt 既能保护后台和重复页面不被收录,也能有意识地决定是否让内容进入 GPT、Claude、Perplexity 这些 AI 系统的语料和引用库。

2024 年以来主流 AI 爬虫(OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、PerplexityBot 等)都支持通过 robots.txt 单独控制。允许它们抓取,你的内容就有机会出现在 AI 助手的回答里(GEO 优化的前提);禁止则完全缺席 AI 渠道。这是内容站 2026 年必须做的一个主动决策,而不是默认搁置。

常见问题

robots.txt 不存在(404)是坏事吗?

不是。robots.txt 是可选文件,404 时按协议所有合规爬虫默认可以抓取全站。大量小站和早期站点没有这个文件,不影响 Google 收录。只有当你需要屏蔽某些路径或控制 AI 爬虫时才需要创建它。

Disallow: / 是什么意思?

表示对相应 User-agent 全站禁止抓取。常见搭配:User-agent: GPTBot 加 Disallow: /,即禁止 OpenAI 抓取你的内容用于模型训练。注意这只对遵守协议的爬虫有效,恶意爬虫不看 robots.txt。

AI 爬虫被禁止后有什么影响?

内容不会进入该 AI 的训练语料或实时引用库。例如禁 GPTBot 后,ChatGPT 的搜索和回答中引用你内容的概率大幅下降。对依赖 AI 渠道引流的站点是损失;对担心内容被白嫖训练的站点是保护。两派都有大站在做,属于商业决策。

sitemap 声明在 robots.txt 里有什么用?

Sitemap: 行告诉爬虫你的站点地图地址,是最省事的提交方式——爬虫每次读 robots.txt 都会顺带发现它,不需要逐个引擎手动提交。检测结果显示 sitemap_count 为 0 时,建议补上(WordPress 站点通常自动生成 /wp-sitemap.xml 或 /sitemap_index.xml)。

通配 * 组和具名组哪个优先?

对同一个爬虫,具名 User-agent 组的规则优先于 * 组。所以站点可以给 Googlebot 完全放行、给 * 设较多限制,再单独给某些 AI 爬虫开小灶或上锁——这正是当前 AI 时代 robots.txt 写法的主流模式。

检测由 dr-tools 实时抓取目标站 robots.txt 解析 · 每分钟限 12 次 · 更多工具见 跨境谷工具箱