GEO 能不能做,不取决于预算多少,而取决于官网现在能不能被检索、有没有稳定的事实、拿不拿得出可以公开核对的东西。三项基础齐了,后面的内容与信源工作才有落点;缺哪一项,投入就会先花在补哪一项上。
第一项:官网能被正常访问和抓取
这一项是技术条件,几周内就能查清,也最容易被误判为「已经没问题」。按顺序查四条。
robots.txt 有没有挡住搜索类爬虫。很多站点在几年前为了省带宽,把一批爬虫整体挡掉了。OpenAI 的文档把后果写得很清楚:「Sites that are opted out of OAI-SearchBot will not be shown in ChatGPT search answers, though can still appear as navigational links.」这里要注意区分:挡住训练用途的爬虫,和挡住搜索用途的爬虫是两件事,官方文档是把它们分开列的。
WAF 或 CDN 有没有把正常抓取当成攻击。Perplexity 的爬虫文档里专门有一节写给使用 WAF 的站点,建议「you may need to explicitly whitelist Perplexity's bots to ensure they can access your content.」如果你的站点在近两年上过云防护,建议实际用日志核对一次,而不是凭配置界面判断。
关键内容有没有被锁在登录墙或表单之后。常见于产品资料库和经销商专区:公开页上只有一句简介,参数、图纸、检测报告都要填表才能拿到。这类结构对真实读者也不友好,同时让可检索的内容大幅减少。
关键信息是不是只存在于图片里。把参数表做成一张 JPG 贴在页面上,人看着没问题,可被取用的文本却接近于零。
这四条对应的官方门槛其实只有一句:页面要被索引,并具备展示摘要的资格。Google 的 AI 特性文档写的是「a page must be indexed and eligible to be shown in Google Search with a snippet」;技术条件之外没有额外要求,但这四条任何一条不通,就等于站在门外。
核实方式建议用两个来源交叉:一是服务器日志,按 user-agent 过滤,看搜索类爬虫最近有没有实际来过、拿到的状态码是多少;二是搜索控制台里的抓取与索引报告,确认重要页面的索引状态。只看配置文件容易漏掉「规则写了但被上游拦截」的情况,比如 CDN 层的规则覆盖了源站的 robots.txt 设置。
第二项:事实是稳定的,并且写成了可核对的形态
「稳定」指的是六到十二个月内不会大改的主体信息:公司名与品牌名、产品型号体系、核心参数的度量口径、认证状态。这些信息反复变动时,任何一次内容整理都会很快过期,AI 取用到的版本也会前后矛盾。
「可核对的形态」指的就是把这类信息写成人能看懂、机器能取用的句子。Bing 团队在 2026 年的文章里把为 AI 回答做支撑的价值单元定义为「Groundable information (discrete, supportable facts with clear provenance)」,也就是离散、可支撑、出处清楚的事实。一段话里塞三件事、每件事都带着「行业领先」这样的形容,就属于既不可支撑也无法核对。
要区分两类信息:稳定事实写进页面主体,长期不改;变动信息(活动价格、临时交期、库存状态)单独标注更新时间和适用范围,不要混在参数表里。
第三项:拿得出可以公开的证据
这一项决定内容能写多深。可用的证据通常有四类:可以公开的测试报告(页数与结论)、有效期内的认证(机构、证书编号、覆盖范围)、可公开的案例(客户类型与项目范围,不必暴露客户名称)、可验证的第三方资料。
Google 在帮助内容的自我评估里有一个问题很贴切:「Does your content clearly demonstrate first-hand expertise and a depth of knowledge (for example, expertise that comes from having actually used a product or service, or visiting a place)?」第一手经验是最难被替代的证据,也恰好是中国制造与技术型企业最不缺、却最少写出来的东西。
如果客户名称、图纸、配方不能公开,正确的做法是写清边界,例如写明「因客户保密要求,不公开客户名称,可提供脱敏测试摘要」。含糊地写「服务过众多知名企业」既不可核对,也让后续所有内容都失去了引用价值。
三项齐了以后才轮到的顺序
基础具备之后,剩下的是内容覆盖与平台范围:先把客户的问句整理成清单,再按客户实际使用的平台确定范围,最后建立可比较的基线。顺序颠倒会把预算花在看不见的地方。
不适合先做 GEO 的五种情形
- 还没有官网,或者只有一个正在改版的首页。先把承载事实的页面建起来。
- 主体信息本身在变,例如刚改名、刚合并、产品线正在重构。先定事实,再谈可见度。
- 客户几乎不从线上检索进入,业务完全依赖既有关系渠道。先把线下资料的准确度做好。
- 团队里没有能确认参数与口径的人。技术事实没人拍板,写出来的内容只会互相矛盾。
- 考核指标本身就是发稿篇数。这个口径下,GEO 很容易变成批量生产低价值页面。
这五种情形不是「不能做」,而是顺序问题。前三种的投入重点分别是建站、定事实和线下;第四、五种属于内部准备不足,先解决再谈外部工作。
三十分钟自查怎么做
- 打开
/robots.txt,看有没有整体挡掉搜索类爬虫。 - 用站内搜索找三个客户常问的问题,看有没有对应页面。
- 随手挑三个产品页,找出其中一句能被完整摘走的参数或定义。
- 找出至少一份可以公开出示的证据,并记下它的范围与有效期。
- 问业务同事:这些口径如果被引用错了,最严重的是哪一条。
五项里能完成四项,就可以开始按资料清单收集交办材料;如果第二项只找到零散的片段,先看五类信息缺口的排查顺序。光算的 GEO 项目从现状诊断开始,先确认这三项基础是否具备,再决定投入重点,服务方式见GEO 服务说明。
这部分通常还要配合其他环节一起做:产品页不被收录的6类技术排查:速度、robots、内链、渲染、URL与标签、SEO初诊要交哪些资料?先给只读信息,再按任务开放权限。
参考来源
- Overview of OpenAI Crawlers — 挡住 OAI-SearchBot 会让站点从 ChatGPT 搜索答案中消失,仍可能以导航链接出现。
- Perplexity Crawlers — 使用 WAF 的站点需要显式放行 Perplexity 的爬虫,否则内容可能无法被访问。
- AI features and your website — 被索引并具备展示摘要资格是出现在 AI Overviews 或 AI Mode 的前提。
- Evolving role of the index: From ranking pages to supporting answers — 为 AI 回答做支撑时的价值单元是离散、可支撑、出处清楚的事实。
- Creating helpful, reliable, people-first content — Google 建议用第一手经验与知识深度来评估内容,这与中国制造型企业的资料优势直接相关。