Robots.txt 检测器
输入任意网站域名,一键解析其 robots.txt:规则数量、User-agent 分组、sitemap 声明,以及 14 个主流 AI 爬虫(GPTBot / ClaudeBot / PerplexityBot / CCBot 等)的抓取权限对照——判断一个站点对搜索引擎和 AI 助手分别开放到什么程度。
关于 Robots.txt 与 AI 时代抓取权限
robots.txt 是网站与爬虫之间的协议文件:搜索引擎和 AI 公司的爬虫在抓取你的网站前会先读取它,遵守其中 User-agent / Disallow / Allow 规则。写得好的 robots.txt 既能保护后台和重复页面不被收录,也能有意识地决定是否让内容进入 GPT、Claude、Perplexity 这些 AI 系统的语料和引用库。
2024 年以来主流 AI 爬虫(OpenAI 的 GPTBot、Anthropic 的 ClaudeBot、PerplexityBot 等)都支持通过 robots.txt 单独控制。允许它们抓取,你的内容就有机会出现在 AI 助手的回答里(GEO 优化的前提);禁止则完全缺席 AI 渠道。这是内容站 2026 年必须做的一个主动决策,而不是默认搁置。
常见问题
robots.txt 不存在(404)是坏事吗?
不是。robots.txt 是可选文件,404 时按协议所有合规爬虫默认可以抓取全站。大量小站和早期站点没有这个文件,不影响 Google 收录。只有当你需要屏蔽某些路径或控制 AI 爬虫时才需要创建它。
Disallow: / 是什么意思?
表示对相应 User-agent 全站禁止抓取。常见搭配:User-agent: GPTBot 加 Disallow: /,即禁止 OpenAI 抓取你的内容用于模型训练。注意这只对遵守协议的爬虫有效,恶意爬虫不看 robots.txt。
AI 爬虫被禁止后有什么影响?
内容不会进入该 AI 的训练语料或实时引用库。例如禁 GPTBot 后,ChatGPT 的搜索和回答中引用你内容的概率大幅下降。对依赖 AI 渠道引流的站点是损失;对担心内容被白嫖训练的站点是保护。两派都有大站在做,属于商业决策。
sitemap 声明在 robots.txt 里有什么用?
Sitemap: 行告诉爬虫你的站点地图地址,是最省事的提交方式——爬虫每次读 robots.txt 都会顺带发现它,不需要逐个引擎手动提交。检测结果显示 sitemap_count 为 0 时,建议补上(WordPress 站点通常自动生成 /wp-sitemap.xml 或 /sitemap_index.xml)。
通配 * 组和具名组哪个优先?
对同一个爬虫,具名 User-agent 组的规则优先于 * 组。所以站点可以给 Googlebot 完全放行、给 * 设较多限制,再单独给某些 AI 爬虫开小灶或上锁——这正是当前 AI 时代 robots.txt 写法的主流模式。