区分抓取与索引,关键是看同一组规范化信号在两个阶段分别被谁使用:抓取阶段由爬虫决定“要不要来、来哪个地址”,索引阶段由搜索引擎决定“把哪个地址当作代表、是否展示”。URL规范化在抓取阶段主要影响爬虫能否到达页面、是否重复抓取;在索引阶段才决定多个等价地址中哪一个被合并、哪一个被展示。因此,日志里出现抓取不等于已收录,收录了也不代表展示的是你期望的规范化地址。
抓取阶段,爬虫读取的是可发现性和可达性:内链、站点地图、robots.txt、HTTP 状态码、重定向链。索引阶段,搜索引擎读取的是内容等价性:canonical 标签、重定向、参数处理、内容重复度。这两组信号不通用。例如,robots.txt 的抓取限制不等于可靠的索引移除:被禁止抓取的 URL 仍可能因外部链接被索引,只是没有抓取内容。站点地图也不保证收录,它只帮助发现,不承诺抓取和索引。因此,把“已提交站点地图”当成“已收录”是常见的协作误判。
多人协作时,返工往往来自各自看不同报表。建议固定三类数据,并明确各自只能回答什么问题:
如果日志显示爬虫频繁访问带参数的旧地址,而搜索结果展示的是规范化后的短地址,说明抓取阶段仍在消耗预算,但索引阶段已合并。反之,如果搜索结果展示的是旧地址,而 canonical 指向新地址,说明索引阶段尚未采纳你的规范化信号,需要检查信号是否一致、是否被其他更强信号覆盖。
假设你有一个页面存在 ?ref=abc 参数版本,希望规范化到无参数版本。按以下步骤判断当前处在哪个阶段:
判断结果对应不同动作:从未抓取时,先修内链和站点地图;已抓取但未合并时,统一 canonical、重定向和内链指向;已合并但仍有抓取时,可观察一段时间,不必反复改动信号。每次改动后保留日志与抽样记录,便于协作时对齐“改了什么、看哪个指标、等多久”。
把“抓取”和“索引”拆成两个验收项,分别指定负责人和证据来源。抓取验收看日志与状态码,索引验收看搜索结果抽样与规范化信号一致性。交付说明中写清楚:本次改动影响的是抓取路径还是索引代表地址,预期在哪个数据源上先变化。HTTPS 不保证安全无漏洞或排名,它只是协议层条件,不应作为抓取或索引判断的依据。不同搜索引擎对 canonical、参数处理和站点地图的支持情况须分别核查,不能用一个引擎的结果推断另一个。
下一步:选一个当前存在多地址的页面,按上面的四步记录一次日志、一次信号检查和一次搜索结果抽样,把三项证据放在同一份交付说明里,再决定是否需要改动规范化信号。