域名注册记录本身不决定页面能否被抓取或收录。要区分访问抓取与索引结果,先看服务器日志和搜索控制台里的抓取统计,再看索引覆盖报告,最后用 site: 查询做抽样验证。抓取是搜索引擎请求了你的页面,索引是它把页面存入可检索库,两者是先后关系,不是同一件事。时间和人手有限时,先处理“已抓取但未索引”的页面,再处理“未抓取”的页面,因为前者往往只差内容质量或重复问题,后者可能卡在链接结构或 robots 规则上。
要查什么:搜索引擎爬虫有没有请求你的 URL,返回状态码是什么。怎么查:在服务器访问日志中按爬虫 User-Agent 过滤,统计每个 URL 的请求次数和状态码。结果说明什么:出现 200 说明抓取成功;出现 301 或 302 说明发生了跳转;出现 403 或 429 说明被拒绝或限流;出现 5xx 说明服务器当时出错。如果日志里完全没有某 URL,说明它还没被抓取,此时讨论索引为时过早。
注意,robots.txt 的抓取限制不等于可靠的索引移除。被 robots 阻止的页面仍可能因为外部链接被索引,只是搜索引擎看不到页面内容。要真正阻止索引,应使用 noindex,并且这个标签必须能被爬虫抓取到才生效。
要查什么:URL 是否出现在索引中,以及未索引的具体原因。怎么查:在搜索控制台的页面索引报告中按状态分组,重点看“已抓取但未编入索引”和“已发现但未编入索引”两类。结果说明什么:前者表示爬虫来过但认为内容不值得索引,常见原因是内容单薄、与站内其他页面高度重复、或者页面只是聚合列表;后者表示爬虫知道这个 URL 但还没安排抓取,通常和站内链接太少或站点权重不足有关。
站点地图不保证收录。它只是告诉搜索引擎有哪些 URL 可供发现,提交后仍需爬虫抓取、解析、判断质量,才可能进入索引。把站点地图当作收录保证,会误判后续工作方向。
要查什么:报告里显示已索引的 URL,实际能不能被搜到。怎么查:从已索引分组中随机抽 5 到 10 个 URL,逐个用 site:完整URL 查询,看是否返回该页面。结果说明什么:如果报告说已索引但抽样查不到,可能是索引还在更新,也可能是页面被替换成了另一个版本。抽样要覆盖不同类型页面,比如文章页、分类页、产品页,不要只查首页。
HTTPS 不保证安全无漏洞,也不保证排名。它只说明传输层加密,和抓取、索引没有直接因果关系。排查时不要把 HTTPS 当成索引问题的解释项,除非证书错误导致爬虫无法建立连接。
Disallow 规则挡住。如果被挡,先判断是故意限制还是配置错误,再决定是否放开。site: 查询确认报告和实际结果一致。不一致的 URL 单独记录,观察下一次抓取后的变化。判断顺序可以简化为:日志里没有抓取记录,就先解决发现和抓取;日志里有抓取但索引报告说未索引,就先解决内容质量和重复;索引报告说已索引但抽样查不到,就先观察,不要立刻改页面。不同搜索引擎的支持情况和报告口径需要分别核查,不能拿一个平台的结论直接套到另一个平台。
下一步:从服务器日志中导出最近 7 天的爬虫请求,按状态码分组,把 5xx 和 403 的 URL 单独列成一张表,先处理这张表里的问题,再回头看索引覆盖报告。