跳至正文
精选文章 · Google SEO

“已发现,尚未编入索引”怎么排查:从GSC状态到真实抓取日志

// / / 光算科技

GSC显示“已发现,尚未编入索引”,意思是Google已经知道这个地址,但报告中尚没有抓取记录。排查时先核对同一个URL的检查日期和抓取情况:页面打不开,就修访问;没有稳定入口,就补发现路径;已经抓取却未收录,则继续查正文和规范页。这几个问题的处理方法不同,反复点提交并不能替代检查。

先选一条重要的产品页或文章,从它的地址查起。若首页以外的大批页面同时异常,再用Sitemap与规范URL对账方法寻找共同问题:可能是同一个模板,也可能是某个目录的规则。这样既能追清一条页面的状态,也不会漏掉需要批量修复的地方。

“已发现”和“已抓取”,差在Google有没有读过页面

Google网页索引报告说明[1],“Discovered - currently not indexed”表示页面已被发现但尚未抓取。Google给出的常见原因是预计抓取可能使网站过载,于是重新安排时间,因此上次抓取日期可能为空。这是一项状态解释,不能直接当成你的网站已经过载的诊断。是否需要调整主机,还要看实际访问和错误记录。

看到的状态目前能确认什么优先动作
已发现,尚未编入索引Google知道地址,当前记录尚未抓取核对入口、访问稳定性与日志覆盖
已抓取,尚未编入索引页面已被读取,但未进入索引查看抓取版本、正文、重复与规范页
网页会自动重定向提交地址不是最终落点检查跳转目标,而非反复提交旧地址
备用网页,有适当的规范标记该地址可能是合理的重复版本检查重要内容是否在规范页收录

另一种情况是“已抓取,尚未编入索引”:Google已经读过页面,只是没有把它放入索引。它以后可能被索引,也可能不会;Google没有要求为这一状态反复提交。Google的状态定义[1]并未把它等同于处罚。重定向页、合理的备用页也无需一律消除,先检查重要内容是否由正确的规范页面进入搜索。

诊断树:已发现未抓取先查入口和响应;已抓取未索引查正文和规范页;已索引再看查询与点击

先按记录中的抓取状态选择方向,再用页面、日志和GSC复查。此图为诊断示意,并非GSC界面。

把地址和检查时间记在一起

从浏览器复制最终页面地址,协议、主机名、路径大小写、尾斜杠和查询参数都保留下来。发生跳转时,起始地址和最终地址各记一列。否则很容易检查的是参数页,拿来比较的却是主版本。打开GSC后也要确认当前资源覆盖这个URL,别在另一个子域名或协议版本里寻找记录。

  1. 先保存网址检查里的索引状态、检查日期、上次抓取时间,以及工具实际显示的用户声明规范页和Google选择的规范页。没有显示的字段填“工具未提供”。
  2. 修复后运行实时网址测试,查看是否抓取成功、是否允许索引,以及渲染页面里有没有主要正文。这是对当前页面的检查,不是已收录通知。
  3. 把上线、解除拦截、修改正文或canonical的时间补到记录里。比对时先问:Google上次抓取发生在修改前,还是修改后?

这一步能解释不少“明明改好了,GSC却没变”的情况。索引版本记录的是Google此前处理的页面,实时测试检查的是现在能取得什么。Google的网址检查工具说明[2]也说明,实时测试不能检查所有索引问题,例如不能据此排除重复页。测试通过之后,仍要等同一URL的索引记录更新。

页面能打开,还要确认返回了什么

先退出登录访问页面,再让技术人员检查HTTP响应和完整跳转过程。有时状态码是200,正文却是登录提示、地区限制、验证码、空结果,甚至“页面不存在”。采购商和爬虫需要读到的产品资料并没有返回。查到误拦截后,只调整计划公开的页面和相应规则,不要为了抓取开放客户资料或关闭全站安全防护。

检查项要取得的证据发现异常后怎么处理
响应码与跳转原始URL、每次跳转、最终正文修复错误路由或失效目标;地图和内链改用正确落点
robots.txt目标主机规则与适用路径仅修正误拦截;保留应受保护目录
noindexHTML及X-Robots-Tag响应头仅对计划公开索引的页面移除误设指令
canonical当前声明与预期规范页修复批量指向首页、测试域名或不对应页面的问题
正文读取页面源码、实时测试渲染内容检查内容接口、脚本错误和关键资源拦截

robots.txt和noindex也要分别查。前者控制抓取,不能可靠地用来禁止索引;页面被robots.txt挡住时,Google又可能读不到其中的noindex。索引报告的robots与noindex说明[1]说明了这一区别。对于希望收录的页面,既要让Google能够读取,也要排除误设的索引限制,不能只看到其中一项允许就停止检查。

故障出现在哪里,往往能帮你缩小修改范围。产品页全部异常、文章页正常,优先查产品模板;只有某个语言目录异常,先查语言路由和目录规则;各类页面都间歇性失败,再结合CDN、安全事件与主机状态排查。不要还没找到出错位置,就同时改缓存、升级服务器和删除文章,那样也难以判断哪项修改起了作用。

日志里出现Googlebot,先核验身份

向运维索取目标URL在指定时间段的访问记录,至少需要时间与时区、主机、路径及查询参数、状态码、客户端IP和User-Agent。日志已经记录响应耗时的,也一起查看。分享前去掉Cookie、令牌、表单内容和个人信息;排查抓取不需要把完整生产日志发进公开群聊。

先问清日志来自哪一层。请求命中CDN缓存时可能根本不回源,只查源站会漏掉它;代理没有正确传递客户端地址时,日志里留下的可能只是代理IP。再确认文件是否经过轮转、采样,以及覆盖了哪些日期。没找到请求,只能说明在这份日志范围内没有检出,不能据此判断Google从未访问。

  1. 按完整目标URL筛选请求,把同一时段的错误响应也留下来,不只统计200。
  2. User-Agent可以被仿冒。核验来源IP时,先做反向DNS查询,检查域名是否符合Google公布的官方后缀,再正向解析,确认结果包含原始IP;也可对照相应爬虫的官方IP范围自动检查。
  3. 分开记录搜索爬虫、其他Google爬虫和用户触发的检查请求。刚点过实时测试,不能把随后的测试访问当成常规抓取已经恢复。
  4. 按页面汇总访问日期、响应和唯一URL数量。同一页面被访问多次,仍然只是一条已访问URL。

DNS核验和IP列表的具体用法见验证Google请求的官方方法[3],其中还区分了爬虫与提取器类别。核验后再把请求放回页面时间线:抓取的是修改前还是修改后的版本,返回的是完整正文还是错误页。只有确认了这些,日志中的一次访问才对当前问题有解释力。

抓取前查入口,抓取后查页面是否值得保留

入口不妨沿着买家的访问路线检查:分类里能否找到产品,专题里能否进入具体说明,分页能否到达较早文章。把重要页面接到合适的分类和相关正文里,比全部堆到首页更有用。Google可以通过已知页面上的链接或Sitemap发现地址,见页面发现说明[1];没有一个加满就保证收录的内链条数。

专题可以继续做,但每页要回答不同的问题。总览讲选型路线,材料页讲适用介质,安装页讲空间和工况限制,读者需要进一步了解时再互相链接。不要把一篇答案拆成几个近似页面,仅靠来回串联制造一个专题。锚文本直接说明下一页讲什么,无需计算它与标题重合了多少字。

如果真实日志已经证明抓取,而索引没有进展,注意力就该转向页面本身。产品页是否只有型号不同、介绍完全一样?文章是否重复站内已有答案?主要内容是否依赖一个经常失败的接口?真实规格、选型限制、安装步骤和授权图片,都能为页面增加独有信息。先补买家缺少的资料,不要为达到某个字数而把同一结论反复展开。

修复后,继续跟踪原来的那批页面

下面的空白记录结构可直接用于自查,每条URL独立一行,未知项留待补充。取样要包含新旧页面、不同模板和不同异常状态。保留这批样本,后续才能看清具体哪些页面有了变化;只挑容易收录的新页面来比较,会把原先没有解决的问题藏起来。

记录字段填写规则
URL与页面类型保留原地址,另列最终地址与规范页
基线与变更记录GSC检查时间、状态、修复内容及上线时间
日志覆盖与身份注明日志层级、时间范围和来源核验方法
复查与责任记录同一URL的新状态、仍缺证据、下一步负责人

完成修改后,先确认页面确实返回了新版本。少量重点URL可按权限请求编入索引,大批页面则使用准确的Sitemap。请求重新抓取说明[4]说明,重复请求同一地址不会加快抓取,而且提交有配额。记录“已请求”即可,不要提前填成“已抓取”;复查日期可以约定,但不能把24小时或几天写成所有网站必定完成的期限。

基础检查完成后,再考虑GPC或GSI

页面公开可读、内容和规范关系清楚、站内入口正常,但重要URL仍迟迟没有发现或抓取进展时,可以把检查结果带给光算评估。GPC爬虫池提供月租独享池、独立后台和自主上传,通过资源与链接路径引导发现;GSI谷歌收录服务围绕提交的URL开展收录促进,按URL规模确认服务,并约定检查时间与报表。一个侧重资源自主使用,一个侧重按清单委托执行。

noindex没有解除、canonical指错、正文重复或访问失败时,应先把页面修好。两种服务怎样选择,可继续看GPC与GSI选型对照,再按正式服务页核对费用、配置、保障条件和各自承担的工作。光算承担的是双方约定的服务责任,索引是否建立仍由Google判断;购买更多资源也不能代替页面修复。

初次沟通可准备3至5个示例URL,附GSC截图、检查日期、Sitemap地址,以及能否提供脱敏日志。这个取样数量只为便于了解问题,不是套餐数量。通过客服中心沟通未收录排查说明当前是“已发现未索引”,有哪几项检查已经完成;账号密码不用发到公开渠道。

拿不到服务器日志,也可以先查GSC索引版本、实时测试、响应和入口,再向主机或CDN提供方申请记录。缺少日志意味着部分实际访问暂时无法确认,第三方工具显示的蜘蛛数字不能替代目标站日志。

后续若状态变成“已抓取”,说明Google已经读取页面,接下来检查索引和规范页。若已经索引,只是没有点击,就应转去看搜索需求、页面竞争力和询盘路径,不再继续按抓取不足处理。

参考资料