AI 爬虫访问检测
输入你的网站域名,工具会分别「伪装」成 Googlebot、GPTBot、ClaudeBot、PerplexityBot、CCBot 五个身份实测访问:每个身份抓 robots.txt 和首页各一次,对照 robots 规则与服务器实际拦截行为——检测你的站点在 AI 时代是「嘴上欢迎、实际拦人」还是真的开放。
为什么 robots.txt 说不禁、爬虫却进不来
很多站长在 robots.txt 里没写任何 Disallow: GPTBot,以为 AI 爬虫可以正常抓取——但主机层(Cloudflare WAF、宝塔防火墙、Wordfence、Bluehost 等shared host 的 UA 黑名单)可能早就按 UA 特征把非浏览器流量拒之门外,返回 403/406。协议层和执行层是两道独立的门。
本工具的价值就是同时测两道门:用真实爬虫 UA 逐一敲门,robots 状态和首页状态并列展示。GEO(生成式引擎优化)的第一步不是写 llms.txt,而是确认 GPTBot/ClaudeBot/PerplexityBot 真的能抓到你的页面——抓不到,一切优化都是空中楼阁。
常见问题
检测显示 GPTBot 被 403,怎么解决?
依次排查三层:①CDN/WAF(Cloudflare 的 Bot Fight Mode 或 WAF 规则常见误杀,加 UA 白名单);②安全插件(Wordfence 的防火墙规则);③主机层(部分主机默认拦截非常规 UA,需联系主机商或自定 .htaccess/nginx 规则)。改完用本工具复测,直到首页状态变 200。
Googlebot 正常但 AI 爬虫被拦,会影响 SEO 吗?
不影响传统 Google 排名,但影响 AI 渠道:ChatGPT 搜索、Perplexity、Claude 的网页引用都依赖各自爬虫实时抓取。2026 年 AI 助手已经贡献相当比例的搜索流量,被拦等于主动放弃这个增长渠道——除非你有意禁止 AI 抓取(也是正当策略)。
怎么验证来的是真爬虫不是伪造的?
正规做法是反向 DNS 验证:真 Googlebot 的连接 IP 反查域名以 googlebot.com 或 google.com 结尾;GPTBot 反查 openai.com。本工具不做反查(我们主动访问别人),这个提示是给你分析自己服务器日志时用的——日志里的 UA 可以伪造,IP 反查不能。
robots.txt 禁了还会被抓首页吗?
robots 协议禁止抓取但通常仍允许读取 robots.txt 本身。被 Disallow 的爬虫不会抓页面内容,本工具首页实测若返回 200 只说明「服务器没拦」,结合 robots 规则列看协议层是否禁止——两列都绿才是真开放,只有一列绿就是「嘴上/手上」不一致。
五个身份里 CCBot 是干什么的?
Common Crawl 是非营利项目,每月爬取全网快照供研究者免费下载,是绝大多数开源模型(Llama 系等)训练数据的最终来源。它不像 GPTBot 那样绑定单一商业产品,禁不禁它取决于你对「语料被开源模型学习」的态度。