排查重复页面,核心是找出内容高度相似、但URL不同的页面,并判断哪一个是主版本。对互联网创业项目来说,重复页面会分散权重、浪费抓取预算,还容易让用户和搜索引擎不知道看哪一版。下面这份清单按“查什么、怎么查、结果说明什么”来组织,可以直接用在已有站点上。
要查什么:同一篇文章、同一商品或同一服务页是否存在多个可访问地址。
怎么查:从站点地图、导航链接、站内搜索和外部链接中收集URL,重点关注以下几类:
www 的版本/About 与 /about?ref=、?sort=、?page=结果说明什么:如果多个URL返回相同或几乎相同的主体内容,就属于需要处理的重复页面。若只是URL不同但内容差异明显,则先不用合并,继续观察。
要查什么:这些相似URL是否都被搜索引擎发现,是否都被收录。
怎么查:用站点抓取工具(如Screaming Frog、Sitebulb等,按你实际可用的工具选择)抓取全站,导出标题、描述、正文和状态码,按标题或正文相似度排序。再在搜索引擎中用 site: 指令查看已收录的URL;对重点页面,用引号搜索一段独特正文,看返回哪些地址。
结果说明什么:抓取工具能发现站内重复,搜索指令能确认搜索引擎是否已经收录了多个版本。两者都指向同一批URL时,处理优先级最高。
要查什么:重复是技术原因、内容原因,还是两者叠加。
怎么查:逐项检查以下可能原因:
http 与 https、www 与裸域是否都能打开。用浏览器直接访问两个版本,看是否都返回200。/page 和 /page/,观察是否都返回200而非跳转。结果说明什么:协议和主机名重复属于技术问题,优先用301跳转统一;参数重复可用规范标签或参数处理规则;内容重复则需要决定保留哪一版、合并还是改写。
要查什么:每个重复组里,哪一个URL应该作为主版本。
怎么查:按以下顺序比较:
怎么处理:
rel="canonical" 指向自己,在重复版本上指向主版本。robots.txt 屏蔽抓取,或加 noindex。结果说明什么:处理完成后,重复URL应逐步减少收录,主版本应保持可访问、可抓取。若跳转后仍能打开旧地址,说明跳转未生效或存在缓存,需要继续检查服务器配置。
要查什么:处理是否有效,是否引入了新问题。
怎么查:记录处理前后的收录数量、主版本排名、抓取状态和日志中的抓取频率。对比时要考虑季节、搜索需求变化和数据采集差异,不要只看一天的数据。
结果说明什么:如果重复URL收录下降、主版本抓取增加,说明方向正确。如果主版本反而丢失收录,检查跳转链是否过长、规范标签是否冲突、页面是否被误屏蔽。
下一步,从抓取工具里导出标题重复的URL列表,按重复组逐个确认主版本,先处理协议、主机名和结尾斜杠这三类最容易修复的问题。