/page/2/ 这类地址是列表的第二页,它的任务只有一个:让抓取方能走完你的全部内容。绝大多数站点在这里的毛病不是被惩罚,而是页面上没有指向下一页的真实链接,抓取方根本走不到后面去。地址形态本身不是问题,怎么让它可达才是。

它和文章的第二节是两件事
先分清两个同名的东西。/page/2/ 用在文章列表上时,意思是"这个列表的第二页";而文章被拆成多页时,第二段落在核心里有自己的参数,不走同一个地址。站长之间经常混淆,导致把文章分页的问题按列表分页去改,或者反过来。分页结构的规则属于 WordPress 的实现,这里先划清:核心里每页显示多少条是一站点级设置,在Options API 文档的阅读一节里,posts_per_page 的说明是"在博客页面上最多显示多少篇文章",默认值是 10;同一节还有站点首页显示最新文章还是固定页面、以及固定页面里哪一页承担文章列表这几个设置。改每页条数会直接影响你有多少个分页地址,所以它和 URL 设计是一件事。
官方现在怎么说
Google 关于分页与增量加载的说明是这套口径的主要出处。需要在正文里说明它的位置:这一页放在 Google 文档的电商分节下,页内也把"博客文章或newsletter 标题这类随时间累积的内容"列为适用场景之一,所以它讲的虽然是电商场景的做法,列出的分页规则本身是通用的。页面上给出的三条要求是: 若第二页的标题还重复,再用WordPress 分页标题的核对方法检查渲染后的页面。
- 顺序链接。用 a 标签的 href 从每一页链到下一页,让抓取方能找到后续页面;另外可以考虑从系列里的每一页都链回第一页,以强调这一组的起点。
- 地址正确。给每一页一个唯一地址;不要把第一页当作整个分页系列的规范地址,而是让每一页有自己的规范地址;不要用地址里的 # 号表示页码,因为片段标识会被忽略。
- 不要索引排序或筛选变体。同样的列表换一种排序方式得到的地址,可以用不索引规则或 robots.txt 里的模式匹配来排除。
同一页还有两处值得记住。它说分页系列里的页面"不需要"遵守"标题要各不相同"这一条建议,可以用相同的标题和描述;它也明确写了,Google 过去用 link rel="next" 和 rel="prev" 识别上下页关系,现在已经不再使用这两个标签,虽然其他搜索引擎可能还在用。这两句合起来说明:给 /page/2/ 单独做一个标题不是必需项,而继续输出 rel="next" / rel="prev" 也不会让 Google 重新开始使用它们。
关于抓取行为的关键一句在同页:抓取方寻找可索引页面时,一般会抓取 a 元素 href 属性里的地址,它不会去"点击"按钮,也一般不会触发需要用户操作才更新页面内容的 JavaScript 函数。分页如果靠按钮、靠滚动、靠表单跳转,抓取方就走不到。这一条对第 1 步的操作影响最大。
怎么配:四件事
- 确认分页是真实链接。打开站点任意一个有多页的列表,查看源代码,确认页码与"下一页"是带 href 的 a 元素,不是只有点击行为的元素或脚本。判断依据是 Google 关于链接的说明:一般只有 a 元素带 href 时的链接才被抓取。
- 确认范围限定正确。如果列表带排序、筛选或视图切换参数,那些变体地址要单独排除,避免同一列表产生大量近似地址。分页本身的第 2 页不需要排除。
- 每页条数改之前先算数量。它决定分页地址总数。改小会让分页变多,改大会让深层文章更难被翻到——这个取舍是内容运营的判断,不是技术判断。
- 改完规则类设置后重新保存固定链接。核心里重写规则是生成出来存起来的,改完设置必须刷新一次规则,新规则才会生效,刷新动作在后台的固定链接页面完成。
第 2 步的参数处理和一条链接算一条还是多条:URL 变体的计数问题里讲的是同一类判断,可以对照着看。不索引规则那一层的细节,前面搜索结果页那篇已经拆过,这里不重复。
分页方案在哪些站点上不划算
三种情况。一是内容极少、分页只有一页时,讨论分页没有意义,官方也没有公布过任何页数阈值。二是刻意做成无限滚动的站:这种方式本身不产生可抓的分页地址,走的是另一套方案,而它和分页的取舍在 性能与前端文件处理那篇里已经分开谈过。三是 WordPress 之外的列表场景,比如评论翻页、论坛式列表,它们和文章列表的地址结构不一定一致,需要单独核对。
还有一条边界要写明:Google 关于 robots meta 与 X-Robots-Tag 的说明提到,规则只有在页面允许被抓取时才能被读到;把分页地址直接挡在抓取之外,等于让第 2 条里的不索引规则读不到。分页页面本身是应当允许抓取的,规则的适用对象是排序与筛选变体,不是分页本身,这两者经常被一起写掉,结果连分页也一起挡住了。
怎么验证抓取方能走完
从最外层往里走一遍:首页能不能点到文章列表,列表第 1 页有没有指向第 2 页的真实链接,第 2 页能不能继续往后翻到最后一页,最后一页有没有指回第一页或更早的页。走通一次,整条路径就是通的。走不通的地方用查看源代码确认它是链接还是脚本。
再看日志:连续观察一到两周,看抓取方请求过哪些分页地址,深层页有没有被抓到。这一步比看收录数据更直接,因为分页的问题首先表现为"没被抓到",而不是"被抓到但没排名"。搜索侧的粗查可以用 site:,但索引与检索存在限制,结论以 Search Console 的网址检查工具为准。分页配置的改动放出去之后留出观察期,是这套方法里最容易被跳过、也最不该跳过的一步。