SEO · 排查路径

robots.txt 的上线检查

robots.txt 用于管理爬虫访问,不能作为隐藏页面或阻止索引的安全机制。先区分“不要抓取”和“不要出现在搜索结果中”。

排查步骤

查看、判断、复查

  1. 01

    确认 robots.txt 位于站点根目录,并可被目标爬虫正常读取。

  2. 02

    逐条检查 User-agent、Allow/Disallow、Sitemap 指令,避免规则重叠冲突。

  3. 03

    使用搜索引擎官方工具测试规则匹配结果,验证关键页面是否被正确允许/阻止。

  4. 04

    变更后通过搜索引擎提供的检查工具和抓取报告核对关键 URL 的可访问性。

跟着示例核对

示例内容用于说明方法,非本站探测记录。复核于 2026-10-03。

模拟 robots.txt(无真实抓取)
User-agent: *
Disallow: /draft/
Allow: /draft/public/
Sitemap: https://example.com/sitemap.xml
对照 URL:/draft/private.html、/draft/public/card.html
模拟 HTML:<meta name="robots" content="noindex">

怎样解释结果

按此处 Google 的路径匹配语义,private.html 被禁止抓取,public/card.html 的更具体允许规则可匹配。robots.txt 的禁止抓取不保证 URL 不出现在索引中;HTML noindex 需要爬虫能读取才可生效。

不符合预期时

先区分禁止抓取、禁止索引和保护私人资料。需要隐藏敏感内容时使用认证,不以 robots.txt 代替访问控制;读取失败或规则不清楚时停止发布规则。

修改后复查

用目标搜索引擎的官方工具核对两条 URL 的规则和实际抓取条件;再分别检查 noindex、canonical 和抓取记录。索引更新有时延,不能据单次请求宣称移除成功。

核对 sitemap 与抓取条件 →