用收录查询工具发现同一内容出现重复或冲突信号时,先不要急着删页面。正确顺序是:先判断冲突发生在哪一层——是抓取层(robots.txt、站点地图、内链指向不一致),还是索引层(同一内容有多个可访问地址、规范标签互相矛盾)。抓取层的矛盾只影响爬虫能否到达,索引层的矛盾才决定最终保留哪个版本。处理原则是让所有信号指向同一个首选地址,而不是同时给两个地址发“我是正版”的信号。
假设某站点有 https://example.com/product 和 https://example.com/product?ref=nav 两个地址,内容几乎相同。收录查询工具显示两者都被抓取,其中一个被索引。此时常见错误是:一边给带参数地址加 canonical 指向无参数地址,一边又在站点地图里同时提交两个地址,还在内链里混用。结果工具下次查询可能显示索引版本来回切换。
可执行的处理步骤:
robots.txt 的 Disallow 只阻止爬虫抓取,不等于把已索引页面移除。如果某个重复地址已经被索引,仅靠 robots.txt 屏蔽抓取,它可能仍留在索引里,因为搜索引擎无法重新抓取该页来看到 noindex。正确做法是:若想移除索引,先确保页面可被抓取,再返回 noindex,或使用移除请求工具。收录查询工具如果只显示“被屏蔽”,不要直接理解为“已从索引删除”。
站点地图不保证收录,它只是提交候选地址。当站点地图包含 A 地址、而 A 地址的 canonical 指向 B 地址时,这是明确的冲突信号。判断依据:canonical 是页面级声明,站点地图是站点级提交。两者矛盾时,优先修正 canonical 或把站点地图改为只列首选地址。适用条件:如果 A 是旧版本且已无流量,直接 301 到 B 比保留 A 再加 canonical 更干净;如果 A 仍有独立价值,则不应把它们当作重复处理。
http 与 https 两个版本同时可访问,是典型的协议层重复。HTTPS 不保证安全无漏洞,也不自动解决重复索引。处理方式是让 http 全部 301 到 https,并确保内链、站点地图、canonical 都使用 https 地址。检查项:用工具查询 http 地址是否仍返回 200;若是,说明跳转未覆盖完整。
同一组冲突信号在不同搜索引擎的收录查询工具中可能给出不同结果,因为各家的规范识别与抓取调度不同。不要用 A 工具的“已选规范”直接推断 B 工具的结果。做法是:对每个你关心的搜索引擎分别查询首选地址与重复地址,记录各自显示的索引版本,再逐项统一信号。若某家工具显示“已排除”,先看排除原因字段,而不是直接改代码。
下一步:打开你正在用的收录查询工具,导出当前报告里所有被标记为重复或规范冲突的地址,按上面的五步逐条核对状态码、canonical、站点地图和内链,先改矛盾最明显的那一组,再重新查询验证。