GSC显示“已发现,尚未编入索引”,意思是Google已经知道这个地址,但报告中尚没有抓取记录。排查时先核对同一个URL的检查日期和抓取情况:页面打不开,就修访问;没有稳定入口,就补发现路径;已经抓取却未收录,则继续查正文和规范页。这几个问题的处理方法不同,反复点提交并不能替代检查。
先选一条重要的产品页或文章,从它的地址查起。若首页以外的大批页面同时异常,再用Sitemap与规范URL对账方法寻找共同问题:可能是同一个模板,也可能是某个目录的规则。这样既能追清一条页面的状态,也不会漏掉需要批量修复的地方。
“已发现”和“已抓取”,差在Google有没有读过页面
按Google网页索引报告说明[1],“Discovered - currently not indexed”表示页面已被发现但尚未抓取。Google给出的常见原因是预计抓取可能使网站过载,于是重新安排时间,因此上次抓取日期可能为空。这是一项状态解释,不能直接当成你的网站已经过载的诊断。是否需要调整主机,还要看实际访问和错误记录。
| 看到的状态 | 目前能确认什么 | 优先动作 |
|---|---|---|
| 已发现,尚未编入索引 | Google知道地址,当前记录尚未抓取 | 核对入口、访问稳定性与日志覆盖 |
| 已抓取,尚未编入索引 | 页面已被读取,但未进入索引 | 查看抓取版本、正文、重复与规范页 |
| 网页会自动重定向 | 提交地址不是最终落点 | 检查跳转目标,而非反复提交旧地址 |
| 备用网页,有适当的规范标记 | 该地址可能是合理的重复版本 | 检查重要内容是否在规范页收录 |
另一种情况是“已抓取,尚未编入索引”:Google已经读过页面,只是没有把它放入索引。它以后可能被索引,也可能不会;Google没有要求为这一状态反复提交。Google的状态定义[1]并未把它等同于处罚。重定向页、合理的备用页也无需一律消除,先检查重要内容是否由正确的规范页面进入搜索。

先按记录中的抓取状态选择方向,再用页面、日志和GSC复查。此图为诊断示意,并非GSC界面。
把地址和检查时间记在一起
从浏览器复制最终页面地址,协议、主机名、路径大小写、尾斜杠和查询参数都保留下来。发生跳转时,起始地址和最终地址各记一列。否则很容易检查的是参数页,拿来比较的却是主版本。打开GSC后也要确认当前资源覆盖这个URL,别在另一个子域名或协议版本里寻找记录。
- 先保存网址检查里的索引状态、检查日期、上次抓取时间,以及工具实际显示的用户声明规范页和Google选择的规范页。没有显示的字段填“工具未提供”。
- 修复后运行实时网址测试,查看是否抓取成功、是否允许索引,以及渲染页面里有没有主要正文。这是对当前页面的检查,不是已收录通知。
- 把上线、解除拦截、修改正文或canonical的时间补到记录里。比对时先问:Google上次抓取发生在修改前,还是修改后?
这一步能解释不少“明明改好了,GSC却没变”的情况。索引版本记录的是Google此前处理的页面,实时测试检查的是现在能取得什么。Google的网址检查工具说明[2]也说明,实时测试不能检查所有索引问题,例如不能据此排除重复页。测试通过之后,仍要等同一URL的索引记录更新。
页面能打开,还要确认返回了什么
先退出登录访问页面,再让技术人员检查HTTP响应和完整跳转过程。有时状态码是200,正文却是登录提示、地区限制、验证码、空结果,甚至“页面不存在”。采购商和爬虫需要读到的产品资料并没有返回。查到误拦截后,只调整计划公开的页面和相应规则,不要为了抓取开放客户资料或关闭全站安全防护。
| 检查项 | 要取得的证据 | 发现异常后怎么处理 |
|---|---|---|
| 响应码与跳转 | 原始URL、每次跳转、最终正文 | 修复错误路由或失效目标;地图和内链改用正确落点 |
| robots.txt | 目标主机规则与适用路径 | 仅修正误拦截;保留应受保护目录 |
| noindex | HTML及X-Robots-Tag响应头 | 仅对计划公开索引的页面移除误设指令 |
| canonical | 当前声明与预期规范页 | 修复批量指向首页、测试域名或不对应页面的问题 |
| 正文读取 | 页面源码、实时测试渲染内容 | 检查内容接口、脚本错误和关键资源拦截 |
robots.txt和noindex也要分别查。前者控制抓取,不能可靠地用来禁止索引;页面被robots.txt挡住时,Google又可能读不到其中的noindex。索引报告的robots与noindex说明[1]说明了这一区别。对于希望收录的页面,既要让Google能够读取,也要排除误设的索引限制,不能只看到其中一项允许就停止检查。
故障出现在哪里,往往能帮你缩小修改范围。产品页全部异常、文章页正常,优先查产品模板;只有某个语言目录异常,先查语言路由和目录规则;各类页面都间歇性失败,再结合CDN、安全事件与主机状态排查。不要还没找到出错位置,就同时改缓存、升级服务器和删除文章,那样也难以判断哪项修改起了作用。
日志里出现Googlebot,先核验身份
向运维索取目标URL在指定时间段的访问记录,至少需要时间与时区、主机、路径及查询参数、状态码、客户端IP和User-Agent。日志已经记录响应耗时的,也一起查看。分享前去掉Cookie、令牌、表单内容和个人信息;排查抓取不需要把完整生产日志发进公开群聊。
先问清日志来自哪一层。请求命中CDN缓存时可能根本不回源,只查源站会漏掉它;代理没有正确传递客户端地址时,日志里留下的可能只是代理IP。再确认文件是否经过轮转、采样,以及覆盖了哪些日期。没找到请求,只能说明在这份日志范围内没有检出,不能据此判断Google从未访问。
- 按完整目标URL筛选请求,把同一时段的错误响应也留下来,不只统计200。
- User-Agent可以被仿冒。核验来源IP时,先做反向DNS查询,检查域名是否符合Google公布的官方后缀,再正向解析,确认结果包含原始IP;也可对照相应爬虫的官方IP范围自动检查。
- 分开记录搜索爬虫、其他Google爬虫和用户触发的检查请求。刚点过实时测试,不能把随后的测试访问当成常规抓取已经恢复。
- 按页面汇总访问日期、响应和唯一URL数量。同一页面被访问多次,仍然只是一条已访问URL。
DNS核验和IP列表的具体用法见验证Google请求的官方方法[3],其中还区分了爬虫与提取器类别。核验后再把请求放回页面时间线:抓取的是修改前还是修改后的版本,返回的是完整正文还是错误页。只有确认了这些,日志中的一次访问才对当前问题有解释力。
抓取前查入口,抓取后查页面是否值得保留
入口不妨沿着买家的访问路线检查:分类里能否找到产品,专题里能否进入具体说明,分页能否到达较早文章。把重要页面接到合适的分类和相关正文里,比全部堆到首页更有用。Google可以通过已知页面上的链接或Sitemap发现地址,见页面发现说明[1];没有一个加满就保证收录的内链条数。
专题可以继续做,但每页要回答不同的问题。总览讲选型路线,材料页讲适用介质,安装页讲空间和工况限制,读者需要进一步了解时再互相链接。不要把一篇答案拆成几个近似页面,仅靠来回串联制造一个专题。锚文本直接说明下一页讲什么,无需计算它与标题重合了多少字。
如果真实日志已经证明抓取,而索引没有进展,注意力就该转向页面本身。产品页是否只有型号不同、介绍完全一样?文章是否重复站内已有答案?主要内容是否依赖一个经常失败的接口?真实规格、选型限制、安装步骤和授权图片,都能为页面增加独有信息。先补买家缺少的资料,不要为达到某个字数而把同一结论反复展开。
修复后,继续跟踪原来的那批页面
下面的空白记录结构可直接用于自查,每条URL独立一行,未知项留待补充。取样要包含新旧页面、不同模板和不同异常状态。保留这批样本,后续才能看清具体哪些页面有了变化;只挑容易收录的新页面来比较,会把原先没有解决的问题藏起来。
| 记录字段 | 填写规则 |
|---|---|
| URL与页面类型 | 保留原地址,另列最终地址与规范页 |
| 基线与变更 | 记录GSC检查时间、状态、修复内容及上线时间 |
| 日志覆盖与身份 | 注明日志层级、时间范围和来源核验方法 |
| 复查与责任 | 记录同一URL的新状态、仍缺证据、下一步负责人 |
完成修改后,先确认页面确实返回了新版本。少量重点URL可按权限请求编入索引,大批页面则使用准确的Sitemap。请求重新抓取说明[4]说明,重复请求同一地址不会加快抓取,而且提交有配额。记录“已请求”即可,不要提前填成“已抓取”;复查日期可以约定,但不能把24小时或几天写成所有网站必定完成的期限。
基础检查完成后,再考虑GPC或GSI
页面公开可读、内容和规范关系清楚、站内入口正常,但重要URL仍迟迟没有发现或抓取进展时,可以把检查结果带给光算评估。GPC爬虫池提供月租独享池、独立后台和自主上传,通过资源与链接路径引导发现;GSI谷歌收录服务围绕提交的URL开展收录促进,按URL规模确认服务,并约定检查时间与报表。一个侧重资源自主使用,一个侧重按清单委托执行。
noindex没有解除、canonical指错、正文重复或访问失败时,应先把页面修好。两种服务怎样选择,可继续看GPC与GSI选型对照,再按正式服务页核对费用、配置、保障条件和各自承担的工作。光算承担的是双方约定的服务责任,索引是否建立仍由Google判断;购买更多资源也不能代替页面修复。
初次沟通可准备3至5个示例URL,附GSC截图、检查日期、Sitemap地址,以及能否提供脱敏日志。这个取样数量只为便于了解问题,不是套餐数量。通过客服中心沟通未收录排查说明当前是“已发现未索引”,有哪几项检查已经完成;账号密码不用发到公开渠道。
拿不到服务器日志,也可以先查GSC索引版本、实时测试、响应和入口,再向主机或CDN提供方申请记录。缺少日志意味着部分实际访问暂时无法确认,第三方工具显示的蜘蛛数字不能替代目标站日志。
后续若状态变成“已抓取”,说明Google已经读取页面,接下来检查索引和规范页。若已经索引,只是没有点击,就应转去看搜索需求、页面竞争力和询盘路径,不再继续按抓取不足处理。