跳至正文
WordPress 与 WooCommerce · Google SEO

WordPress 标签页为什么越建越薄:合并还是不索引

// / / 光算科技

标签页越建越薄,不是标签这个功能有问题,是它的默认用法和索引需要的形态对不上。标签是一次性的元信息标注,它默认只产出一个列表,不承诺产出一个页面;把标注直接当页面,薄就是必然结果。这一层是 WordPress 的实现方式,不是搜索侧的判断——搜索引擎怎么对待这种列表页,官方给的是另一套口径,而且它同样没有公布过任何数量阈值。

标签数量随时间增长与每页文章数下降的同向变化示意,标出拐点出现在什么地方,以及可选项只有合并或关掉两个
原创示意:图中为标签页变薄的过程与可选项示意,不是真实后台截图或数据。

它为什么会一路薄下去

机制很简单。标注一个标签的成本是一次点击,而它产出的东西是一个只挂着一两篇文章的地址。写文章时顺手打标,三个月后标签总数会远超分类数,而绝大多数标签下面的文章数量不会增长——因为它们本来就是一次性的标注。标签数与分类数的比例,和标签页的可用率,是两回事。

核心里标签和分类确实是同一类对象:Options API 文档的固定链接一节把 tag_base 与 category_base 并排列出,两者都是固定链接的基址、默认值都为空。也就是说 WordPress 对这两类对象的存储和处理方式一致,它不会因为某项只挂了一篇文章就自动把它藏起来。WordPress 官方文档没有把标签定义为不适合索引的类型,也没有给出保留标签所需的文章数量;这类判断属于内容层面,官方同样没公布过数量阈值。 分类与标签的边界还取决于栏目用途,可接着看WordPress 分类和标签如何分工。

搜索侧能拿来对照的是内容口径。Google 关于有帮助内容的说明在"需要警惕的做法"里列了这样一条:是否在大量不同话题上生产大量内容,指望其中一些能在搜索结果里表现好。这句描述的正是"什么都建一点"的形态——标签库膨胀和它是同一种倾向。同一份文档在自评里问"是否对这个话题给出了充分、完整、全面的描述",这个问题用在只挂一篇文章的标签页上,答案很清楚。

怎么处理:先清点,再按三种方式处理

当前状态建议处理要做的动作
下面文章很多,且是读者会主动找的主题保留并升级为正式页面补独立说明、给它内链入口、纳入导航
下面有几篇文章,主题明确但读者不主动找合并到分类或相邻标签先补跳转,再删原标签
只有一两篇,或全站只用了一次下掉改成正文里的普通文字或直接删掉标注

处理顺序上有个不能颠倒的地方:先处理链接,再删标签。已经存在的外部链接和站内链接指向那个地址时,直接删会让它们撞到 404;先补一条永久重定向,确认旧地址还能落到内容上,再删标签本身。这一步的具体做法和验收顺序,可对照canonical 和外链指向的 URL 有什么关系里对规范地址与旧链接衔接的判断。

怎么改:一份可执行的四步

  1. 导出标签清单和每项下的文章数量,按数量从多到少排序。
  2. 从上往下划一条线:线以上是少数几个值得保留的主题,线以下全部进入合并或下架队列。线的位置由你能持续写多少个主题决定,不是由某个数字决定。
  3. 把线以下的标签逐个处理:合并的先补跳转再改标注;直接下架的先确认没有外部链接指向它。
  4. 改完后在后台重新保存一次固定链接,让基址层面的变更生效。规则类改动为什么必须刷新固定链接,Rewrite API 文档里有明确说明。

第 1 步的清单来源建议交叉核对:后台标签页看一遍,再用抓取方式把实际输出的地址扫一遍,两边对不上的地方通常说明有主题或插件改过标签页输出。附件类页面会不会跟着出问题,可以参考WordPress 附件页关了图片会消失吗:两种 URL 要分开检查里的区分方法。

什么时候不要急着清

三种情况可以按住不动。一是站点内容还很少,标签总量在两位数以内,清点加处理的成本高于收益。二是标签主要在内部检索用、根本不作为入口对外,那就没必要让它进索引,只要确保它不占用抓取资源即可。三是文章主要靠外部渠道带来访问,标签页本来就不是入口,动它不会带来任何变化。

反过来,如果站内已经在用标签页做导航(比如侧栏里列出热门标签),那标签页就是实际入口,处理标准要按正式页面来定,而不是按临时标注来定。这时的判断可以借用什么是 spoke 页:集群里的具体页怎么做里的标准:一个页面如果承担入口任务,就该有自己的内容,而不是只做一次转跳。

怎么验证处理真的有效

先量两件事:现在还剩多少个标签页,其中文章数量低于某个自定线的有多少。这个数字本身就是结论的一部分——如果处理完还有大半标签只挂一两篇,说明线上没改干净,或者发布流程里还留着随手打标的口子。第二件事是看抓取日志:改完之后是否还有抓取方在请求那些已经下架的标签地址,如果持续有,说明有入口没清理干净,通常藏在某个页面模板或小工具里。

最后一步看搜索侧。Google 关于 robots meta 与 X-Robots-Tag 的说明提醒过,这类规则只有在页面允许被抓取时才生效,用 robots.txt 挡掉地址等于让规则永远读不到;处理下架标签时,这两件事要分开做。改完之后留几周再看数据;粗查可以用 site:,但索引与检索存在限制,结论以 Search Console 的网址检查工具为准。