一条外部链接从对方发布出来,到你的报表里出现,中间隔着四道闸门。能被解析、被发现、被抓取、被处理,是四件不同的事,任何一步没过,这条链接对你都还不存在。站长最常见的误判,是把「对方已经发布了」当成「你已经被计入」——这两者之间可能隔着几天,也可能永远隔着那一步。
从发布到被计入的四个环节

先看第一道闸门。官方对可抓取链接的写法要求写明:链接一般必须是带 href 属性的 <a> 元素,其他格式的链接不会被爬虫解析和提取;<a> 元素里的地址还必须能解析成一个真实可请求的网址。文档同时说明,用 JavaScript 动态插入的链接也可以被抓取,前提是插入之后用的正是上面这种 HTML 写法。
第二道和第三道闸门在搜索工作原理文档描述的流程里:页面被爬虫从已知页面提取链接时被发现,随后才可能被抓取;发现不等于抓取,被 robots.txt 禁止或需要登录才能访问的页面不会被抓取。抓取之后进入索引阶段,文档写明这一步并不保证完成。
第四道闸门是「处理」。链接被抓到之后,它提供的信息才会被归到目标 URL 上;这一步的结果要落到你能看的数据里,还有时间差:请求重新抓取的官方说明提到,提交单个 URL 有配额,对同一个 URL 反复请求重抓并不会让它被抓得更快。同一个页面上的改动,官方也写明通常要过几天到几周才会被重新处理。
每一环最容易卡住的位置
把四道闸门对应到具体的排查动作,可以直接拿去用:
| 闸门 | 怎么确认它过了 | 最常见的卡点 |
|---|---|---|
| 一、可解析 | 查看来源页源码,搜 <a 加 href;地址是否是完整可请求的网址 | 用 <span> 或 onclick 伪装成链接;地址写成 javascript: 之类无法请求的形式 |
| 二、被发现 | 目标 URL 在站点地图里,或有站内链接指向它 | 整站没有任何入口能走到这个地址,只能靠外链被发现 |
| 三、被抓取 | 看抓取统计里这个 URL 有没有出现;检查 robots.txt 与登录墙 | 被 robots.txt 屏蔽;页面需要登录;抓取预算长期没轮到这个 URL |
| 四、被处理 | 在链接报告里按目标 URL 查到该条;用 URL 检查工具看该 URL 的状态 | 目标页返回 404 或 5xx;被 noindex;被规范地址指向另一个 URL |
第三道闸门最容易被误读。官方写明爬虫用算法决定抓哪些站点、抓多频繁、每个站点抓多少页,这意味着「有外链」不构成「会被抓」的保证,只是提高被发现的可能性。所以站内主动给每个重要页面至少一条入口,是让第三道闸门更容易过的唯一可控手段。
落点页自己的三道前置检查
在自己这边,下一条链接进来之前先把三件事做完,能省掉后面大半排查:
- 地址能用。打开它,确认返回 200,正文有可读内容。
- 允许被抓取和索引。检查 robots.txt 有没有拦、页面里有没有 noindex,两者要一起看,只查一种会漏。
- 规范地址指向自己。如果这一页有多个地址形态,确保 canonical 指向的就是你要拿链接的那一个,否则信号会归到别处。
第 2、3 项出问题时的排查顺序,见外链发出去却没被收录怎么查。
怎么确认这条链接真的走完了全程
按可见性从低到高做三步,越往后越可信。第一步,直接打开来源 URL,看链接在不在、属性是什么,落点地址是什么。第二步,在 URL 检查工具里输入你的目标地址,看它当前的索引状态和 Google 选取的规范地址是什么,这是最接近官方口径的一手证据。第三步,在链接报告里按目标 URL 查,看这条是否已被记录。三步都过,才在报表里标为「已计入」;只过了第一步的,标为「已发布待核」。
把这三步的结果连同核对日期一起存进表,字段怎么设见确认外链是否被收录。这张表真正的用处不是证明什么,而是让下一次争论回到具体某一天的具体某个地址上。
哪几环不适用这套流程判断
三种情况不要用四道闸门来解释。第一,这条链接是标注了 rel="nofollow" 或 rel="sponsored" 的:官方对这两类属性的定位是标记链接关系,抓取环节的处理方式与普通链接不同,先确认属性再谈后面的环节。第二,你的衡量目标是引荐访问而不是搜索侧的数据,那关心的是访问统计而不是抓取与索引。第三,一个刚上线的站点整体都还没有抓取记录,此时任何单条链接的「是否被计入」都无法单独判断,要先等站点本身被抓取。