WordPress 站上的重复内容,多数不是内容写重了,而是同一个页面被算出了第二个地址。所以处理顺序应该是:先看地址、再看状态码、最后才谈标签 —— 地址不同就不是同一页,noindex 解决不了地址分裂。 除插件复制页外,还要检查打印版和 AMP 插件可能产生的额外地址。
下面六个来源是最容易自己复现的。涉及 WordPress 自身行为的部分,本文引 WordPress 官方文档;涉及搜索与索引的判断,只引 Google 官方文档,两类来源不混着写。
六个来源:先按"谁生成了第二份页面"分组
| 来源 | 典型地址形态 | 先查这一项 |
|---|---|---|
| 固定链接结构改过 | 旧结构路径,或带参数的旧链接 | 旧地址现在返回什么状态码 |
| 协议与主机变体 | http 与 https、www 与非 www、尾斜杠有无 | 这些地址是否都还能打开同一篇 |
| 文章分页与评论分页 | 路径里带页码的地址 | 第 2 页之后是否真有独立内容 |
| 附件页与媒体文件 | 附件页地址与图片文件地址 | 两者是否都还能从站内点到 |
| 插件附加的变体视图 | 打印版、AMP 版、简写地址 | 这些地址由谁生成、能不能关 |
| 各类归档页 | 分类、标签、作者、日期归档 | 这些页是否有独立内容 |
这六类里,第四类与第五类在 WordPress 里可以整类关掉,前三类属于结构问题,归档页要先判断有没有人用得上。

逐项核对:三个动作
- 把上面每一行的地址抄成一张清单,一行一个完整地址,不要用通配符代替。
- 对每个地址各请求一次,记下状态码、最终落到的地址,以及 head 里有没有规范链接。
- 把"打开后内容一样"的地址两两配对,标出你想保留的那一个。
只做这三步,手上就会有一份能直接分派的清单。URL 变体到底算一条还是多条,可以先看站内那篇一条链接算一条还是多条。
处理顺序:先合并信号,再考虑标签
Google 在关于如何指定规范 URL 的说明里把方法排了强弱:重定向是强信号,rel="canonical" 是强信号,把 URL 写进站点地图是弱信号,几种方法可以叠加。但同一份文档也写明,这些方法都不是必需的,不指定规范地址时,Google 会自己选出它认为客观最好的那个版本。所以实际动手时,先做重定向这类能确定"哪个是原件"的动作,再考虑标签。
同一份文档还有一条容易被忽略:不推荐用 noindex 去阻止某一页被选成规范页,因为那会把整页挡在搜索之外,官方给的替代方案是 rel="canonical"。它同时说明,rel="canonical" 元素只对 HTML 页面有效,PDF 这类文件要改用 HTTP 响应头来标注。
这里要划清一条线:WordPress 官方文档讲的是软件本身怎么产生这些地址,它不承诺任何搜索排名或收录效果;上面所有关于索引的判断,依据都来自 Google 文档,而不是 WordPress 文档。
哪些重复可以先放着不管
有两类不必急着处理:一是有人真的会点开的地址,比如图片文件本身、同一个商品的多个规格页;二是只在站内被链接、外部几乎没有引用的归档页。判断依据是"这一份需不需要被单独检索到",而不是数量。Google 从未公布过重复内容的容忍比例,也没有任何"重复页超过 N 条会被处罚"的阈值,这两项目前都属于未公布,写方案时不要填数字。
处理完之后怎么确认真的生效
先看状态码:每一个被合并的地址都应该返回跳转而不是 200。Google 在重定向与 Google Search 的说明里区分得很清楚,永久重定向会被当作"目标地址应为规范"的信号,临时重定向不会。
再看站内链接。Google 在关于链接如何被抓取的说明里提到,站内链接应尽量指向你认为的规范地址,并且每个你在意的页面至少要被站内另一个页面链接到一次。判断外链到底指向哪一版,可以对着canonical 和外链指向的 URL 有什么关系那篇一起做。
最后用检索工具扫一遍前缀。Google 在搜索操作符说明里提醒,site: 前缀可以找某个域名或 URL 前缀的结果,但操作符受索引与检索限制影响,Search Console 的网址检查工具更适合排查,结论以它为准。
需要外部团队把地址规范和重复项梳理成一份可执行清单,可以先看光算的 SEO 服务说明里写了哪些交付物,再决定要不要合作。