Sitemap 提取器

输入任意网站域名,自动定位其 sitemap.xml(sitemap index 自动展开一层子表):统计全部子 sitemap、URL 总数、每个子表的页面数,以及 lastmod 更新时间的月度分布——评估一个站点的内容规模、更新频率和活跃度,选品调研与竞品分析的第一步。

怎么读结果:total_urls 是全站 sitemap 申报的页面总数(内容规模);月度分布看「最近一次大批量更新」在什么时候——近 3 个月有持续更新的站是活跃站,lastmod 全停在一两年前的站大概率弃维护。子表里的 post/page 分类能看出内容型站点与页面型站点的结构差异。

Sitemap 是站点的内容底账

sitemap.xml 是站点主动申报给搜索引擎的 URL 清单,等于把家底摊开给你看:URL 总数是内容规模的最直接口径(比 site: 查询准确得多),子 sitemap 的切分方式暴露内容结构(博客分几卷、产品多少页、页面多少个)。

lastmod 月度分布是活跃度探针:内容站正常应该每月都有新增或更新(分布图右端有柱);如果最近 6 个月全是零、所有 lastmod 停在历史某月,这个站基本停止运营——做竞品分析时这决定你要不要认真研究它,做外链采购时这直接影响该站价值。

常见问题

sitemap 里 URL 数等于收录数吗?

不等于。sitemap 是「站点申报的清单」,收录是「搜索引擎实际采纳的」。申报 1 万条实际收录 3 千很常见(质量过滤、抓取预算)。但反过来,sitemap 数量是内容规模的下限锚点——连 sitemap 都没有的站规模一定不大。

为什么有的站提取不到 sitemap?

sitemap 地址不统一:标准是 /sitemap.xml,WordPress 生成 /wp-sitemap.xml,Yoast 插件用 /sitemap_index.xml(本工具前两者都会自动尝试)。都没有时说明站点未主动提供 sitemap——小站靠外链发现也能被收录,但大规模站点不配 sitemap 是技术缺陷。

lastmod 可以造假吗?

可以且常见——有的站每次全量刷新 lastmod 制造「活跃」假象。识别方法:看月度分布形态,真实更新的站呈细齿状持续分布,造假站呈单一巨柱(某月一次性全量刷新)。结合页面的实际内容变化判断。

sitemap index 和普通 sitemap 有什么区别?

index 是「目录的目录」:里面不装 URL,装的是子 sitemap 列表,适合 URL 过 5 万或按类型分文件的站点(post-sitemap1.xml、page-sitemap.xml 这种)。本工具自动展开一层,把每个子表的 URL 数都统计出来。

做竞品分析时这个工具怎么用?

第一步输入竞品域名拿 URL 总数和结构分布;第二步对照它的 blog 子表规模估算内容投入量级;第三步看 lastmod 最近月份判断它当前的内容节奏。三个数字叠加,比看首页猜规模客观得多。

提取由 dr-tools 实时抓取目标站 sitemap 解析 · 每分钟限 12 次 · 更多工具见 跨境谷工具箱