日志里的User-Agent写着Googlebot,不足以证明请求来自谷歌。可靠的人工核验是:从可信日志取得实际来源IP,反向查询主机名,检查它是否属于对应的Google爬虫域,再正向解析该主机名,确认返回地址包含原IP。少做最后一步,或拿CDN节点IP代替客户端IP,都会让结论失真。
先确认你查的是谁的IP
网站经过CDN或反向代理时,源站看到的连接地址可能属于代理节点。直接对这个地址做DNS查询,只能确认代理是谁。应由运维核对代理链,使用受信任入口提供的客户端地址,或者在CDN请求日志中取得原始来源IP。不要直接相信任意访客都能填写的X-Forwarded-For请求头。
保留一条完整记录:访问时间与时区、主机名、路径、方法、来源IP、User-Agent、返回状态,以及可关联边缘和源站的请求ID。随后再做身份判断。只有IP而没有时间和路径,即使验证通过,也不能证明它就是触发某条防火墙规则的那次访问。
假设产品页出现403,访问日志同时出现两种Googlebot字符串。先分别核验两个实际来源IP,不要把其中一个通过验证的结果套给整批访问。浏览器改UA、SEO软件模拟爬虫与真正Google请求,可以使用相同的文字标识。
反向查域名,再正向查回原地址
Google官方验证文档给出的命令行方法包含反向查询、域名检查和正向回验。下面采用文档中的示例地址,只解释读法,不代表本站刚收到这个IP的请求,也不把示例中的解析结果当成实时结果。
host 66.249.66.1
host crawl-66-249-66-1.googlebot.com
第一条命令查询IP的PTR记录,得到一个主机名;第二条查询该主机名的地址。要确认正向结果中确实包含原来的66.249.66.1。遇到IPv6请求,同样核对相应地址记录,程序比较时按IP地址解析,而不是用未经处理的字符串比较。

原创核验关系示意:域名看起来正确,只完成了一半检查;图中地址为文档示例,不是客户日志。
域名检查必须有边界。以普通Googlebot为例,名称应匹配官方列出的googlebot.com域及其主机名模式;googlebot.com.example.net并不属于googlebot.com。也不能只检查字符串里有没有“google”。脚本处理域名末尾的点和大小写后,应比较完整域名后缀,并结合爬虫类别核对。
属于Google,不等于属于同一种爬虫
官方文档把请求分为常见爬虫、特殊用途爬虫和用户触发的抓取工具,并列出不同反向DNS模式及IP范围。普通Googlebot、AdsBot和用户触发的检查请求不能仅凭“都来自Google”就合并成一类。尤其在解释GSC测试成功、日常抓取却失败时,要分别查看实际访问者和命中的规则。
人工抽样适合DNS双向检查。需要批量核验日志时,可按官方页面提供的相应IP范围文件做地址归属判断,包括IPv4和IPv6。不要从论坛复制一个旧IP白名单长期使用,也不要把Google整个自治系统或云服务地址全部视为Googlebot。范围文件的适用类别和更新时间都应留在核验记录中。
如果DNS请求超时,先标记“本次未确认”,换可靠解析器复查,或使用相应官方IP范围交叉核对。超时不等于伪装,反向记录存在也不等于通过。把成功、明确不匹配和暂时无法确认分开,能避免临时网络故障触发大面积误封。
通过验证以后,怎样给访问规则
验证结果用于判断访问身份,不是关闭全站安全防护的理由。若公开产品页的GET请求被误拦,可以限定到已确认的爬虫类别、公开路径和必要资源,保留后台、登录、写入接口的权限检查。任何请求都不应因为UA里带Googlebot就获得管理权限。
调整后检查两件事:该类公开请求确实不再被误拦,原先应受保护的路径仍然受保护。需要处理共享额度或爬虫降速时,再看429限流的计数对象与恢复检查;身份核验并不能单独解决服务器容量问题。
批量验证别放在每个请求的同步等待里
如果公开页面每收到一次请求就等待多轮外部DNS查询,解析延迟可能变成新的访问瓶颈。批量日志分析可以离线完成;确需接入访问控制时,让维护人员设计结果缓存、更新周期、超时处理及失败回退,而不是把教学命令直接拼进生产请求链。
官方IP范围文件下载失败时,也不要用空列表无条件覆盖仍有效的已知结果。应保留失败记录,由系统明确区分“数据更新失败”和“IP不在范围”。同样,一份来源不明的列表即使格式完全正确,也不应进入放行规则。输入来源、解析验证和安全回退,与DNS判断本身一样需要检查。
验证记录还应标注取得结果的时间。后来查询成功,能够帮助定位访问身份,却不能证明当时的安全系统也已经使用同一份结果;解释误拦原因时要回到当时规则版本。
交给开发的记录应能复查
一份可执行的记录至少写明:原始日志位置、可信客户端IP从哪一层取得、PTR结果、正向结果、爬虫分类依据、匹配的安全规则,以及调整前后同类请求的状态。不要只贴一句“已加谷歌白名单”。复查者需要知道到底放开了哪条公开访问路径。
光算的谷歌SEO服务包含网站技术建议;涉及抓取访问问题时,可结合项目确认日志分析、规则调整建议与开发协作范围。身份验证通过只能说明请求归属,不能证明页面已经被索引,更不能据此承诺排名恢复时间。
如果网站没有保留可信客户端IP,当前最值得做的不是继续猜爬虫真假,而是先补齐可关联的访问记录。等下一次请求到来,再对同一条记录完成双向验证和响应核对,结论才有对应的对象。