重复页面排查的核心是找出内容高度相似、只有URL或参数不同的页面,并确认它们是否都能被访问、被索引、互相竞争。最直接的办法是先用站内搜索和抓取工具列出所有可访问URL,再按标题、正文摘要和规范链接分组比对,最后决定保留、合并还是设置规范。
要查的是站点实际能返回内容的地址,而不是只依赖后台文章列表。可以用爬虫工具抓取,也可以先用site:指令配合不同路径观察收录概况,再把结果导出。检查项包括:带参数的地址、带?page=的分页、大小写不同的路径、带与不带结尾斜杠的版本、打印页或AMP页。
结果说明:如果同一内容出现多个可访问URL,并且都返回200状态码,就存在重复页面风险。若其中一个跳转到另一个,则属于重定向处理,通常不按重复内容竞争看待。
把导出的URL逐条查看页面标题、H1和正文前200字,记录内容相同但URL不同的组。重点看商品筛选页、标签页、作者归档页、分页和参数页。对每组至少打开两个地址,确认正文主体是否一致。
判断结果:标题相同、正文主体相同、仅URL不同,属于明显重复;标题不同但正文主体大段相同,属于近似重复;只有导航和页脚相同、正文不同,不算重复页面。
查看每个重复页面的<link rel="canonical">指向哪里,再用搜索引擎的URL检查工具看它是否被索引。要查的是:规范链接是否指向自己、是否指向同一组的首选版本、被指向的页面是否可访问且返回200。
结果说明:如果A页规范到B页,但B页不可访问或规范到C页,说明规范链断裂,需要修正。如果两个页面都规范到自己且都被索引,则两者可能同时参与竞争,应确定唯一首选版本。
按业务价值选择处理方式:有独立搜索需求且内容有差异的页面保留;内容几乎相同且无独立价值的页面合并到主页面;仅参数不同但需要保留的页面设置规范链接。可执行清单如下:
rel="canonical"指向主版本。noindex处理,但不要同时禁止抓取,否则无法看到noindex。适用条件:如果重复页面有独立流量或转化,先观察再合并;如果只是技术参数产生的副本,优先规范或重定向。
处理完成后,记录改动日期、涉及URL和改动类型。比较前后数据时,要同时看季节、搜索需求和采集差异,不能只看某一天排名。检查项包括:目标页面是否被索引、规范链接是否生效、重复URL是否逐渐减少、主页面流量是否稳定。
判断结果:如果重复URL减少且主页面索引正常,说明处理方向正确;如果主页面流量同步下降,需要检查是否误合并了有独立需求的页面,或规范指向了错误版本。
下一步:从当前站点导出全部可访问URL,按标题和正文摘要做一次分组,先处理规范链接指向错误和多个版本都返回200的页面。