跳至正文
关键词研究 · Google SEO

SEO 中的 NLP 是什么?Google 如何理解语义与搜索意图

// / / 光算科技

在 SEO 中,NLP(自然语言处理)通过分析语义和用户意图,帮助搜索引擎更准确地匹配页面内容。据 2024 年 Moz 的一项研究,78% 的高排名页面应用了该技术;

BERT 是一种 NLP 模型,Google 用它来理解单词和意图的组合;不存在适用于 SEO 的公开“70%”配额,BERT 也不会按 E-E-A-T 指南为内容颁发认证。

语言版本:中文 · English

我会详细讲解Google如何利用NLP让搜索结果更“懂你”。

什么是自然语言处理

NLP(Natural Language Processing,即自然语言处理)是一种允许计算机理解、分析和生成人类语言的技术。

全球每天都会进行超过 85 亿次搜索(来自 Google 2024 的公开数据),大约 60% 的查询包含隐含语义或模棱两可的表述(例如“Apple”可以表示水果、电话或音乐专辑)。

传统搜索引擎只知道 “匹配关键词”,而NLP可以将杂乱的文本分解为语义单元(例如将“iPhone 15型号2025防水测试”分解为三个实体:“2025型号”、“iPhone 15”和“防水测试”),然后通过上下文关系(例如“防水”和“智能手机功能”之间的关系)构建语义网络,最终让机器“理解”文本背后的真实意图。

从“关键词匹配”到“语义理解”的演变

要理解 NLP 如何让 Google 真正“阅读”文本,我们需要回到搜索引擎的“婴儿期”: 20世纪90年代至2000年代初。

当时,搜索技术如同“单词词典”一样原始:如果用户输入“咖啡”,引擎就会简单地拉出包含“咖啡”一词的所有页面。

有些人故意在页面上重复“减肥”、“减肥”、“减肥”,结果被搜索“减肥”的人找到。

机械“字计数器”(1990 年代 - 2000 年代初)

早期的搜索引擎(例如 1995 年的 AltaVista 和 1998 年的 Yahoo)使用 TF-IDF(词频 - 逆文档频率),其本质上意味着“计算一个单词在页面上出现的次数:出现的次数越多,页面的相关性就越高”。

例如,如果用户搜索“Java”,系统会把“Java 编程”“Java 教程”等词出现频率高的页面排在前面;但如果他遇到关于“Java 咖啡”(一种咖啡)的页面,他可能仍然会因为“Java”出现多次而将其错误分类为相关。

2003年,加州大学伯克利分校的一项研究分析了当时主要搜索引擎的结果:当用户搜索“苹果”时,前20个结果中有45%与水果相关,30%与苹果产品相关,剩下的 25% 则是“苹果派食谱”“苹果树种植”等无关内容。用户必须手动过滤结果,平均点击 3.2 个链接才能找到他们想要的内容(Forrester 2003 数据)。

一些网站开始“钻空子”:例如,当用户搜索“最佳笔记本电脑”时,低质量网站会在页面上重复“最佳”、“笔记本电脑”、“推荐”等词语,甚至使用隐藏文字(白底白字)进行关键词堆砌。

2005年,谷歌不得不公开承认:“大约30%的低质量页面通过关键词堆砌进入前10名。” (Google 搜索质量团队的内部报告)

统计模型的“模糊推理”(2000 年代中期 - 2010 年代初期)

2000年代中期,随着在线内容的爆炸性增长(2000年大约有10亿个网页,2010年大约有500亿个网页),仅仅依靠关键词计数变得完全无效。

搜索引擎开始引入 语言统计模型,试图通过“上下文概率”来理解单词之间的关系。

例如,谷歌在 2008 年推出了 “短语匹配”技术:系统不再只关注单个单词,而是分析某些句子组合出现的频率。

例如,如果用户搜索“如何准备咖啡”,系统会优先考虑同时包含“准备”、“咖啡”、“水”和“温度”等单词的页面,而不是仅包含“咖啡”的页面。这项技术将结果的相关性提高了约 12%(数据来自 Google 2009 年的技术博客)。

2012年,谷歌进一步推出 “知识图谱”,将孤立的单词转化为“实体+关系”的网络。

例如,“爱因斯坦”不再只是一个词,而是被贴上“物理学家”、“出生于德国乌尔姆”、“提出相对论”等属性的标签。

当用户搜索“爱因斯坦”时,系统不仅返回传记页面,还直接显示出生和死亡年份、名言,甚至解释“相对论”的页面链接。

知识图谱推出后,谷歌官方数据显示: 40%的用户搜索需求被直接满足(无需点击任何链接) (2013 年 Google 官方演示)。

但这仍然不够:知识图谱依赖于手动注释的“结构化数据”,而互联网上 90% 的内容由未注释的“非结构化文本”(例如博客和论坛)组成。为了让机器理解这种“混乱的文本”,需要更强大的技术。

从“统计规律”到“语义理解”(2010 年代中期至今)

2010 年代,深度学习(尤其是神经网络的发展)的进步从根本上改变了 NLP。 2013年,谷歌研究员 Tomas Mikolov 提出 Word2Vec 模型,首次将单词映射到“向量空间”:例如“king”和“queen”之间的向量差异与“man”和“woman”之间的差异非常相似,这意味着模型可以“理解”单词之间的语义关系。

2016 年,Google 在搜索中引入 RankBrain(一种基于深度学习的排名算法),能够自动“学习”用户搜索行为与内容相关性之间的关系。

例如,如果用户搜索“廉价无线耳机”,RankBrain 会分析点击后哪些页面的停留时间更长、跳出率更低,从而推断出“廉价”、“无线”和“耳机”之间的真实关系。

根据 Google 2017 年公布的数据,RankBrain 将 长尾查询(不常见搜索词)的相关性提升了 25% (如“适合跑步的骨传导耳机推荐”)。

2018年,谷歌推出了 BERT 模型(双向 Transformer 架构),彻底解决了“上下文模糊”的问题。传统模型只能“单向”(例如从左到右)理解句子,而 BERT 同时分析“之前发生的事情和之后发生的事情”。

例如,在句子“小明的苹果熟了”和“小明咬了一口苹果”中,BERT 可以从上下文中推断出在这两种情况下“苹果”都指的是水果。但如果这句话是“小明的苹果发布了新系统”,BERT 会立即识别出“苹果”意味着公司。

BERT 的效果是立竿见影的:

谷歌2019年的内部测试表明复杂查询的 CTR(点击率) 从 18% 提升至 25%;

2023 年,根据 Google 搜索联络团队的公开数据,BERT 使 模糊查询的准确率从 58% 提高到 82% (例如,当用户搜索“Python”时,模型可以根据上下文了解它是编程语言还是蛇,提高了 24 个百分点。)

从“对词”到“懂人”

纵观 NLP 的演变,核心是搜索引擎从“机械执行指令”到“理解人类需求”的转变:

  • 1.0 时代(关键词匹配):机器如同一个“单词计数器”,只能按字面匹配;
  • 2.0 时代(统计模型):机器如同一个“概率分析师”,通过上下文概率推断意图;
  • 3.0 时代(深度学习):机器如同一个“语言学徒”,可以从大数据中“学习”语义逻辑。

2024 年,皮尤研究中心的一项调查显示, 78% 的用户认为如今的搜索结果“更符合实际需求”,而2010年这一比例仅为41%。

谷歌首席科学家杰夫·迪恩表示:“NLP的目标不是让机器‘阅读文本’,而是‘理解人’。”

NLP的“核心工作”

为了让机器“理解”文本,NLP 必须逐步处理语言中存在的“信息片段”,如同人类分解句子一样。

当Google的NLP系统(例如BERT的改进版本)处理页面内容时,它严格遵循四个步骤来“解码”文本: 分词 → 实体识别 → 语义关联 → 上下文修正。

第一阶段:分词

分词是 NLP 的第一步。简言之,它将连续的文本序列划分为独立的“语义单元”(称为“标记”)。

中文的单词之间没有自然空格(与英语不同,“apple pie”有空格),因此分词是中文 NLP 的核心难点之一。

技术原理:

谷歌的分词系统采用了混合的“规则+深度学习”模型:

  • 规则库:包含数百万中文常用组合(如“煮咖啡”、“手冲水壶”、“防水测试”),优先匹配;
  • 深度学习模型:BERT 的微调版本,可动态预测词表中不存在的单词(例如“多巴胺穿搭”等新术语)。

实际案例:

以“如何制作一杯浓郁芳香的手冲咖啡?”为例,分词系统必须确定正确的切分方式。可能的候选细分:

  • 错误的切分:“如何/制作一/杯/芳香的/手冲/咖啡”(破坏了“一杯”“手冲咖啡”等合理组合);
  • 正确的切分:“如何/制作/一杯/芳香的/手冲咖啡”(符合汉语自然用法)。

支持数据:

谷歌2023年内部测试显示,其分词系统在常见中文网页上的准确率达到97.3%,但在法律、医学等 YMYL 专业领域的罕见术语上,准确率仅为 89%,因为可用于专业术语搭配的规则较少。

为了解决这个问题,谷歌进一步训练了垂直页面的“域分词模型”(例如,医学模型存储了“心肌梗死”和“冠状动脉”等术语的正确分割)。

第二阶段:实体识别

分词后,NLP 必须识别文本中的“实体”,即人物、物体、时间、地点和事件等关键信息。

实体是内容的“骨架”,帮助机器快速识别页面的主题。

技术原理:

谷歌使用一个 多任务学习模型(Multi-Task Learning)同时训练实体识别、词性标记(例如名词和动词)和关系提取。

该模型预测每个标记是否属于某个实体并标记其类型(例如“时间”、“产品”、“人员”)。

实体类型示例:

类型 定义 示例(摘自“2025年iPhone 15防水测试”页面)
时间 时间点/间隔 “2025 年 9 月”
产品 具体产品 “iPhone 15”“IP68防水等级”
事件 事件/行动 “防水测试”“发布”
属性 实体的属性/特征 “深度6米”“30分钟”(具体防水参数)

实际案例:

当处理“2025年9月iPhone 15的IP68防水测试显示在 6 米水深下坚持了 30 分钟”这句话时,实体识别系统会产生:

  • 时间:“2025 年 9 月”
  • 产品:“iPhone 15”
  • 属性:“IP68防水等级”“6米深度”“30分钟”
  • 事件:“防水测试”

支持数据:

根据 Google 2024 技术博客,其实体识别模型在一般领域文本中实现了 92% 的召回率(即正确识别的实体与所有真实实体的比率),但在长文本(超过 5000 个字符)中,召回率下降到 85%,因为实体的密度较低,模型往往会遗漏一些实体。

为此,谷歌推出了“分段处理”策略:将长文本分成500个字符左右的段落,逐段识别实体,然后将结果合并,使长文本的召回率高达90%。

第三阶段:语义关联

在分词和实体识别之后,NLP 必须澄清单词之间的逻辑关系(例如“属于”、“因果”、“属性”),将分散的标记转化为结构化的语义网络。

这个阶段决定了机器是否真的能够“理解”句子的真正含义。

技术原理:

谷歌采用基于 预训练语言模型 + 知识图谱 的混合方法:

  • 预训练模型(如 BERT)从大量文本中学习单词之间的“隐式关系”(例如,“跑鞋”和“运动装备”具有层次关系);
  • Google 的知识图谱提供了结构化知识(例如“iPhone 15”的品牌是“Apple”,上市日期是“2023 年 9 月”),用于验证和完善模型学到的关系。

关系类型的示例:

关系类型 定义 示例(来自“如何选择跑鞋”页面)
层级关系 A 是 B 的子类(反之亦然) “跑鞋” → “运动装备”(跑鞋属于运动装备)
属性关系 A是B的特征/参数 “缓震中底” → “跑鞋”(缓震中底是跑鞋的属性)
因果关系 A 导致 B “体重过重” → “膝盖损伤”(体重过重会导致膝盖损伤)

实际案例:

当处理句子“选择跑鞋时,缓震中底至关重要,因为它可以减轻膝盖的压力”,语义关联系统将建立:

  • “跑鞋”和“缓震中底”之间的属性关系。
  • “缓震中底”和“减少膝盖压力”之间的因果关系。

支持数据:

谷歌2023年的内部测试表明,其语义关联模型识别常见关系的准确度为88%,但对于复杂关系(例如“间接因果关系”)的准确度仅为72%。例如,在“长时间穿不合适的鞋子会导致足弓变形,进而导致背痛”这句话中,“不合适的鞋子”和“背痛”之间的关系是间接因果关系,模型往往认为二者没有直接联系。为了解决这个问题,谷歌引入了“思想链推理”:通过中间节点连接两个遥远的实体(例如“足弓变形”),识别复杂关系的准确率上升到85%。

第四阶段:上下文修正

有些单词单独看是有歧义的(例如“Apple”可以表示水果或品牌),因此需要通过组合整个段落甚至整个页面来纠正其含义。

这是NLP“理解”文本的关键阶段,也是最依赖上下文的阶段。

技术原理:

谷歌使用一个 双向注意力机制 (如 BERT 的核心设计),它允许模型同时“查看”句子的开头和结尾,动态调整每个标记的含义。

例如,当模型处理“小明的苹果熟了”时,“苹果”的初始含义可以是“水果”;

但在处理下一句“他计划使用 Apple 发布新系统”时,模型返回到之前的上下文,并意识到“发布新系统”与水果无关,从而将“Apple”的含义更正为“科技公司”。

实际案例:

以“苹果最新发布的iPhone 15支持卫星通信,这对户外爱好者来说是个好消息”内容为例:

  • 如果你只看“Apple”这个词,模型可能会将其误解为“水果”;
  • 当与下一个短语“发布 iPhone 15”结合使用时,模型会将“Apple”更正为“科技公司”;
  • 加入“户外爱好者”的提法,进一步证实了iPhone 15的“卫星通信”功能与户外场景挂钩。

支持数据:

2024年 Google 用户行为研究表明,在不明确的查询场景(例如搜索“Python”)中,经上下文校正的结果,其相关性比未经校正的结果高 37%。

在页面处理中,上下文校正将模糊术语含义的正确识别率从 62% 提高到 89%(数据基于 Google 内部测试)。

NLP每天为用户节省30%的搜索时间

用户搜索时,最直接的体验是: “我能更快地找到我想要的东西吗?”

根据微软 2024 年用户行为报告, 通过 NLP 优化的搜索引擎,找到所需信息的平均时间从 87 秒下降到 59 秒(减少约 30%)。

不明确的查询

搜索时,大约 40% 的查询包含歧义词(例如“Apple”、“Python”、“Java”)。传统搜索引擎将这些查询视为单独的关键词,返回许多不相关的结果。

借助 语义消歧(Word Sense Disambiguation,WSD),NLP可以根据上下文建立单词的真实含义,直接过滤掉不必要的内容。

具体表现:

  • 案例一:搜索“Python”:用户可能想要查找有关编程语言的教程(62%),或有关蛇的信息(18%),或与Python语言相关的查询(20%)。传统引擎返回所有包含“Python”的页面,用户必须手动过滤掉前3页中的10-15个不相关链接;通过NLP的介入,系统可以从页面内容的上下文(例如“print()函数”或“网页抓取教程”)推断用户的意图,优先显示编程结果。在 Google 2023年内部测试中, 对于不明确的查询,第一屏上的有效结果百分比从 38% 增加到 72%,而平均点击次数从 2.3 下降到 1.1。
  • 案例2:搜索“Java”:用户可能会搜索编程语言(55%)、印度尼西亚爪哇岛旅游指南(25%)或一种咖啡品类(20%)。通过分析页面上的相关词语(例如编程中的“JVM”和“Spring框架”,旅游中的“海神庙”和“火山”),NLP可以快速识别用户的真实需求。皮尤研究中心 2024 年的一项调查显示 完成模糊搜索所需的时间从 112 秒降至 68 秒 (少 40 秒)。

技术支持:

NLP的消歧能力是基于“上下文向量”和“知识图谱”的双重验证。

例如,当用户搜索“Java”时,模型会提取页面上存在的其他关键词(例如“咖啡”、“编程”、“岛”)并将其映射到知识图谱实体(“Java(编程语言)”、“Java(岛)”),然后通过计算向量相似度(例如余弦相似度)确定最相关的实体,最后返回正确的结果。

隐性需求

用户搜索词 通常只表达中心需求的10%-20%;剩下的80%-90%是隐含的(例如“价格”、“难度”、“使用场景”)。

通过 语义扩展,NLP可以从中心术语开始延伸相关需求,主动覆盖甚至用户未明确表达的意图。

具体表现:

  • 案例一:搜索“减肥食谱”:用户可能暗示“低热量”、“容易制作”、“适合上班族”、“无糖”等需求。传统引擎仅匹配包含“减肥”和“食谱”的页面,并且可能会显示“极端饮食”或“复杂糕点食谱”;通过 NLP,系统会分析通常与“减肥”相关的单词(例如“卡路里”、“快速”、“自制”),并优先展示“15 分钟低热量早餐”“适合带去上班的食谱”等页面。2022年 Google A/B 测试表明 在涵盖隐性需求的结果中,用户的停留时间从 45 秒增加到 78 秒(+73%),因为不必再进行“低热量减肥食谱”这样的二次搜索。
  • 案例2:搜索“下雨时穿什么”:用户可以暗示“防水”、“防滑”、“轻便”、“保暖”等需求。传统引擎返回通用结果,例如“雨衣”或“雨伞”; 而 NLP 可以识别“雨天”场景的属性(湿度、滑倒风险),并将其与“防水材料”、“防滑鞋底”、“可折叠便携性”等特征联系起来,从而推荐“防水冲锋衣”或“防滑靴子”等具体产品。2024 年 eMarketer 的调查显示, 覆盖隐性需求的电商搜索,转化率从3.2%升至5.8% (用户更有可能点击购买)。

技术支持:

语义扩展依赖于“词向量空间”和“用户行为数据”的训练。

例如,Google 的 BERT 模型将“减肥食谱”映射到高维向量空间,其中“低热量”和“易于制作”等词在向量方面非常接近;

同时,系统分析历史搜索数据(例如,搜索“减肥食谱”的用户经常点击“低热量早餐”),进一步验证这些隐性需求的相关性,最终生成扩展术语词典。

跨场景适配

用户搜索的场景(时间、地点、设备)直接影响需求。由于 情境意识,NLP 可以动态调整其对查询的理解,并提供更适合当前上下文的结果。

具体表现:

  • 时间场景:如果你在冬天搜索“夹克”,NLP会优先搜索“加厚”、“保暖”、“羽绒”等关键词;如果你夏天搜索“夹克”,首先会显示“防紫外线”、“轻薄”、“透气”的单品。根据谷歌2023年季节性搜索数据, 上下文适应后,用户对结果的满意度从 68% 升至 85% (因为结果更好地响应季节性需求)。
  • 地理场景:如果你在上海搜索“火锅”,NLP会推荐该地区的热门场所;如果你在成都搜索“火锅”,优先考虑的是正宗的四川火锅。在 2024 年 Google 地图和搜索集成测试中, 适应当地环境后,用户点击“附近商户”的概率从22%上升到47% (因为结果更相关)。
  • 设备场景:如果你在智能手机上搜索“我附近的加油站”,NLP 会优先选择“导航”、“实时燃油价格”和“最近”(适合在移动中快速决策)等结果;而在电脑上,它可以显示“加油站列表”、“用户评论”、“促销活动”(适合更深入的咨询)。微软 2024 年针对多种设备的研究表明 适配设备后,用户完成任务所需时间减少42% (智能手机从 90 秒降至 52 秒,计算机从 120 秒降至 69 秒)。

技术支持:

上下文感知依赖于“元数据提取”和“实时数据集成”。

例如,系统从查询中提取时间(通过设备时间)、位置(通过IP或GPS)和设备类型(智能手机/计算机),并通过将它们与实时数据(例如天气、交通和商店开业状态)相结合来调整语义权重。

例如,如果你在下雨天搜索“夹克”,系统会实时检索该地区降水的概率,并强化“防水”属性的权重。

NLP 如何节省时间

场景类型 传统搜索(无 NLP) 使用 NLP 优化搜索 节省时间 数据来源
歧义查询(Python) 第一屏有 10 个结果,5 个不相关 第一屏有 8 个结果,其中 7 个相关 40秒 2023年 Google 内部测试
隐性需求(减肥食谱) 需要再次搜索“低热量” 第一屏直接显示低热量食谱 25秒 皮尤研究中心 2024 年调查
跨场景(夏天找夹克) 结果包含冬季款式,需要手动筛选 第一屏仅展示夏季防紫外线款 30秒 微软2024多场景研究

Google 搜索 NLP 如何“理解”页面文本

谷歌的 NLP 技术通过四个步骤将页面文本转化为机器可理解的“语义网络”:“分词 → 实体识别 → 语义关联 → 上下文修正”。

每天处理超过 500 亿个单词(谷歌数据 2024),分词准确率达到 97.3%,实体识别召回率达到 92%,最终可自动区分“Apple”是指水果还是手机,“Python”是对应编程教程还是蛇。当用户搜索相关内容时,第一屏有效结果的百分比从 38% 上升到 72%(2023 年内部测试)。

分词:将文本划分为“最小机器可理解的块”

简而言之,这意味着将连续的文本序列分解为有意义的“最小语言单元”(称为“标记”)。

对于像英语这样有自然空格的语言,按空格切分即可(例如“coffee mug”变成“coffee”+“mug”);

但对于像中文和日语这样缺乏空格的语言,分割错误可能会完全损害后期的实体识别和语义理解。

规则库+深度学习

谷歌的分词系统采用混合模型 “规则库优先,深度学习补充”,其中心目标是“快速准确地”分割文本。

规则库

规则库是谷歌分词系统的“基础”。它收录世界主要语言的高频搭配模式(例如中文的“准备咖啡”、“手冲水壶”、“防水测试”,以及英文的“浓缩咖啡机”、“滴滤咖啡”)。这些搭配源自对网络文本的统计分析:Google 抓取网页,计算每对相邻单词的共现频率(例如,“咖啡”出现在“准备”之后的概率为92%,而“米饭”出现在“准备”之后的概率为85%),最终形成了数以百万计的词条的“搭配词典”。

例如,在处理中文句子“如何冲泡一杯浓郁芳香的手冲咖啡”时,规则库会优先考虑“冲泡/咖啡”和“手冲/咖啡”等高频组合,正确分割为“如何/冲泡/一杯/芳香/手冲咖啡”;

如果遇到“Java 编程”,规则库会将“Java”识别为编程语言,将“编程”识别为动作,将其切分为“Java/编程”,而不是错误地切成“Jav/a/prog/rammazione”。

深度学习

尽管高效,但规则库无法涵盖所有情况:每天,互联网上都会出现许多新词(例如“多巴胺穿搭”、“metaverse”)和专业术语(例如法律中的“缔约过失责任”或医学中的“心肌梗死”),但这些术语并未包含在规则库中。在这些情况下,Google 会调用 微调 BERT 模型 进行动态预测。

BERT(双向 Transformer)是一种预先训练的语言模型,可以从上下文中理解单词的含义。

例如,当遇到规则库中不存在的术语“多巴胺穿搭”时,BERT 可以从上下文(例如“鲜艳的颜色”、“好心情”、“时尚”)推断出这是一个描述服装风格的新术语,并将其分割为单个“多巴胺穿搭”单元,而不是错误地分割。

技术细节对比:

技术类型 优点 限制 使用场景
规则库 高速(毫秒响应) 它不涵盖新词/专业术语 常规通用文本
微调 BERT 模型 动态识别新词和专业术语 计算成本高(需要GPU) 新领域、长尾文本

多语言适配

Google 支持 100 多种语言的分词,但各种语言的特征差异很大,因此规则和模型必须根据具体情况进行调整。

中文:无空格+高度歧义

汉语的难点在于没有空格和一词多义。例如,短语“乒乓球拍卖结束”可以用两种方式进行分段:

  • 正确:“乒乓球拍/卖完了”(其中“乒乓球拍”为产品);
  • 错误:“乒乓球/拍卖/完了”(其中“拍卖”被解释为动作)。

谷歌通过以下方式解决了歧义 上下文概率模型:“乒乓球拍”作为单个单元的同现频率(例如电商页面中的 90%)远高于“乒乓球+拍卖”的组合(体育新闻中仅为 5%),因此优先考虑正确的切分。

阿拉伯语:从右到左书写+链接拼写

阿拉伯语是从右向左书写的,在某些情况下,词与词之间没有明显分隔。谷歌的分词系统首先把阅读顺序反转成可从左到右处理的方向,然后使用规则库来识别正确的边界。

斯瓦希里语:粘着语言的特征

斯瓦希里语是一种粘着语言,通过在词根上添加词缀来表达含义(例如“mtoto”表示“孩子”,“watoto”表示“孩子们”)。谷歌的分词模型可以识别词缀边界,正确地将“watoto”分割成可以解释为“复数+孩子”的结构。

Google 的 2023 年多语言分词测试显示,英语和西班牙语等主要语言的准确率达到 98%,但阿拉伯语和斯瓦希里语等更复杂的语言的准确率仅为 92%。

为改进效果,谷歌为每种语言组建“语言专家团队”,手动标注10万多个典型句子,用于训练专用分词模型。

分词错误如何影响搜索结果

分词是 NLP 后续所有阶段的基础。如果分割不正确,可能会导致实体识别失败、语义相关性扭曲,最终导致搜索结果相关性下降。这里有两个真实案例:

案例一:“爪哇咖啡”电商页面

其中一页的标题是“Java 咖啡:手冲咖啡的柔和口感”。正确的标记应该是“Java/coffee/:/pour-over level/soft/taste”。如果分割不正确,实体识别系统可能会将无意义的序列解释为单独的实体,从而阻止 Google 将它们链接到正确的产品“Java 咖啡”。当用户搜索“Java Coffee”时,页面会被错误过滤。

案例2:法律页面“缔约过失责任”

一篇法律博客中有这样一句话:“缔约过失责任是指一方当事人违反诚实信用原则而给另一方造成的损害”。适当的分词应该将“缔约过失责任”作为一个单一的法律术语。如果被不当切分成多个孤立的词,实体识别系统将无法将其与正确的法律概念联系起来,导致该页面在“缔约过失责任”这一查询中的排名下滑。

支持数据:

Google 的内部测试表明,分词错误可能会导致目标页面在搜索结果中下降 3-5 个位置(2023年 A/B 测试数据),并将用户点击它的可能性降低 42%(由于结果的相关性较低)。

从文本中“提取”要点

当用户搜索“iPhone 15型号2025年防水测试”时,Google必须快速了解页面的核心是“iPhone 15”(产品)、“2025年9月”(时间)、“防水测试”(事件)。

这些关键信息被称为“实体”(Entity)。

多任务学习模型(Multi-Task Learning)

Google 的实体识别系统基于 多任务学习模型(Multi-Task Learning),同时训练“实体识别”、“词性标注”和“关系提取”三个任务,通过共享基础参数来提高效率。

简而言之,模型同时学习:

  • 哪些词是实体(例如“iPhone 15”是一种产品);
  • 它们在句子中的语法作用是什么(例如“iPhone 15”是一个名词);
  • 实体之间存在什么关系(例如“iPhone 15”由“Apple”生产)。

基本技术细节:

  • BERT 微调:从Google预训练的BERT模型开始,对大量标注数据(如维基百科、新闻、电商页面)进行微调,以学习实体的上下文特征。例如,在“iPhone 15 于 2023 年 9 月发布”这句话中,“2023 年 9 月”和“iPhone 15”通过 BERT 上下文向量连接,模型可以理解前者是时间,后者是产品。
  • 实体类型分类器:BERT 的输出层添加了一个“类型分类头”,用于预测每个实体的具体类型(如 TIME、PRODUCT、PERSON)。该分类器基于 50 多种预定义实体类型(涵盖一般领域和垂直领域),例如:
实体类型 定义 示例
时间 时间点/间隔 “2025 年 9 月”“30 分钟”
产品 具体产品 “iPhone 15”“手冲水壶”
人 人物(真实或虚构) “蒂姆·库克”“张小龙”
地点 地点(具体或抽象) “上海” “GitHub”
事件 事件/行动 “防水测试”“发布会”
属性 实体的属性/特征 “IP68防水等级”“6米深度”

从通用领域到垂直领域的“识别精准度”

Google 的实体类型系统分为通用领域(涵盖日常文本)和垂直领域(针对专业内容)

通用领域实体类型(50+):

它们覆盖了90%的用户搜索场景,例如:

  • 时间(TIME):具体日期(“2025年9月”)、持续时间(“30分钟”)、时间间隔(“2020-2025”);
  • 产品(PRODUCT):电子设备(“iPhone 15”)、家用电器(“手冲水壶”)、日用消费品(“咖啡豆”);
  • 地点(LOCATION):城市(“上海”)、国家(“美国”)、组织(“Google”)。

垂直领域实体类型(行业特定):

对于法律、医学、科技等专业内容,Google进一步训练专门的实体类型,例如:

  • 法律领域:增加“法律规定”(如“民法典第十条”)、“法律行为”(如“缔约过失”);
  • 医疗领域:增加“疾病”(如“心肌梗死”)、“药物”(如“阿司匹林”)、“手术”(如“PCI”);
  • 科技领域:增加“算法”(如“BERT”)、“编程语言”(如“Python”)、“硬件架构”(如“ARM”)。

支持数据:

谷歌2023年的内部测试表明,一般领域的实体识别准确率为92%,而在垂直领域(如法律)初始准确率仅为78%(因为专业术语和标注数据不足)。

通过单独训练“法律领域实体识别模型”(基于超过10万条法律文本标注),准确率提升至90%;医疗模型基于5万多份标注病历训练,准确率达到88%。

从候选检测到边界定义的“四个阶段”

我们以处理这句话为例:“2025年9月iPhone 15的IP68防水测试显示,它在6米水深下坚持了30分钟。”

第一阶段:候选检测——找到可能的实体“种子”

该模型首先扫描文本,并根据规则库(例如“年+月”是时间候选,“数字+产品名称”是产品候选)和统计概率(例如“iPhone”后面出现数字的概率为90%),标记可能的实体候选。

  • 候选1:“2025年9月”(符合“年+月”规则);
  • 候选2:“iPhone 15”(符合“产品名称+型号”规则);
  • 候选3:“IP68防水测试”(符合“技术参数+动作”规则);
  • 候选4:“深度6米”(符合“数量+单位+属性”规则);
  • 候选5:“30分钟”(符合“数量+时间单位”规则)。

第二阶段:类型分类——为候选打标签

通过多任务模型的“类型分类头”,模型为每个候选分配类型:

  • “2025年9月” → TIME(时间);
  • “iPhone 15” → PRODUCT(产品);
  • “IP68防水测试” → EVENT(事件);
  • “深度6米” → ATTRIBUTE(属性,描述防水深度);
  • “30分钟” → ATTRIBUTE(属性,描述防水持续时间)。

第三阶段:边界确定——修正实体的“起止位置”

有些候选的边界可能有误(例如“IP68防水测试”可能被切分为“IP68”+“防水测试”)。该模型通过上下文向量检查边界:

  • “IP68”是一个防水等级标准(因此归为 ATTRIBUTE 属性),但“IP68防水测试”整体是一个事件(EVENT 事件),所以边界修正为“IP68防水测试”;
  • “深度6米”中,“6米”为数值,“深度”为属性;整体归为属性(ATTRIBUTE)更合理。

第四阶段:全局校验——结合全文修正错误

该模型生成整个段落的“全局语义向量”(代表整体主题,例如“智能手机防水测试”),并检查局部实体是否与整体主题冲突。例如:

  • 如果文本主题是“智能手机评测”,那么“iPhone 15”作为产品与主题一致;
  • 如果“IP68防水测试”被归类为事件,也与“智能手机评测”主题一致,因此不需要更正。

Google 如何确保实体识别准确性

测试维度 初始精度(2020) 优化后的准确度(2024) 改进方法
通用域 85% 92% 新增100万条标注数据,优化BERT微调参数
长文本(>5000 个字符) 78% 90% 引入“分段处理”策略(切分为每段500字符)
垂直领域(法律) 78% 90% 特定领域的模型训练(超过 100,000 个带注释的法律文本)
新兴实体(例如“多巴胺穿搭”) 62% 85% 结合BERT的上下文预测能力,动态识别新术语

用户反馈:

Google 收集用户搜索行为的数据(例如,点击的页面是否实际包含目标实体)来反向优化模型。

例如,如果用户搜索“iPhone 15防水等级”,但点击的页面没有将“IP68”标记为属性,则模型将调整其参数以加强对与“防水等级”相关的实体的识别。

在单词之间“创建关系”并建立逻辑

当用户搜索“适合跑步的鞋子”时,Google需要知道“跑步”和“鞋子”(功能用途)之间以及“缓震中底”和“跑鞋”(属性)之间的关系,才能返回真正相关的结果。

这种“在单词之间建立关系”的能力被称为 语义关系提取(Semantic Relation Extraction)。

预训练模型和知识图谱

1. 预训练模型:从海量文本中“自学”关系

预训练模型(如 BERT、PaLM)是语义相关性的主要“学习者”。通过分析数万亿的在线文本(例如网页、书籍和论坛),它们自动捕获单词之间的隐含关系。例如:

  • 在“跑鞋适合长距离”、“篮球鞋适合跳跃”等句子中,模型学习“跑鞋”与“长距离”、“篮球鞋”与“跳跃”之间的功能使用关系;
  • 在“iPhone 15 搭载 A16 Bionic 芯片”和“MacBook Pro 搭载 M3 芯片”这样的句子中,模型学习“iPhone 15”和“A16 Bionic 芯片”之间以及“MacBook Pro”和“M3 芯片”之间的“搭载”关系。

技术细节:

预训练模型通过“上下文嵌入”(Contextualized Embedding)表示每个词的含义。

例如,“跑鞋”的向量根据上下文在不同的句子中发生变化(例如“跑鞋有良好的缓冲作用”与“跑鞋有时尚的外观”),使模型能够捕捉这些细微的差异并确定单词之间的具体关系。

2.知识图谱:利用结构化知识“验证+整合”关系

虽然预先训练的模型可以学习隐式关系,但它们也可能会犯错误(例如,将“苹果”和“水果”之间的关系误解为“品牌”)。

此时,Google 的知识图谱(包含超过 5 亿个实体和 200 亿个关系)提供结构化知识,用于验证并补充模型学到的关系。

例如,当模型分析“iPhone 15屏幕供应商是三星”这句话时:

  • 预训练模型从上下文中学习“iPhone 15”和“三星”之间的“供应商”关系;
  • 知识图谱中已存在结构化关系“iPhone 15 → 屏幕供应商 → Samsung”,据此校验后最终确认“iPhone 15”与“Samsung”的关联。

从基本到复杂:“关系网络”

谷歌定义 超过20种细分关系类型,覆盖90%的用户搜索场景。这些关系可以分为三大类:

1. 基本关系(通用领域)

关系类型 定义 示例(来自“如何选择跑鞋”页面)
层级关系 A 是 B 的子类(反之亦然) “跑鞋” → “运动装备”(跑鞋是运动装备的一部分)
属性关系 A是B的特征/参数 “缓震中底” → “跑鞋”(缓震中底是跑鞋的属性)
功能用途 A是为了B “手冲壶” → “冲泡咖啡”(手冲壶用于冲泡咖啡)
时间顺序 A 发生在 B 之前/之后 “发布” → “上市”(产品先发布,再推向市场)

2.复杂关系(垂直领域)

对于法律、医学和技术等专业内容,Google 添加了更精细的关系类型:

  • 法律领域:“缔约过失责任” → “违反诚实信用原则”(因果关系); “《民法典》第10条” → “婚姻的有效性”(范围关系)。
  • 医疗领域:“心肌梗塞” → “冠状动脉阻塞”(病因关系); “阿司匹林” → “抑制血小板聚集”(药理作用关系)。
  • 科技领域:“Python” → “网页抓取教程”(应用范围关系); “ARM 架构” → “低能耗”(技术特征关系)。

从候选关系提取到全局校验的“五个阶段”

我们以“选择跑鞋时,缓震中底是必不可少的,因为它可以减轻膝盖的压力”这句话为例:

第一阶段:提取候选关系——寻找可能的“关系种子”

该模型首先扫描文本,并根据规则库(例如结构“X是Y的基础”可以暗示功能使用关系)和统计概率(例如“缓震中底”和“跑鞋”之间同时出现的概率为90%),标记可能的候选关系。

  • 候选1:“跑鞋”和“缓震中底”(可能的属性关系);
  • 候选2:“缓震中底”和“减少膝盖压力”(可能的功能使用关系)。

第二阶段:关系类型分类——给候选打标签

使用预训练模型的“关系分类头”,系统为每个候选分配类型:

  • “跑鞋”和“缓震中底” → 属性关系(缓震中底是跑鞋的属性)。
  • “缓震中底”和“减少膝盖压力” → 功能使用关系(缓震中底用于减少膝盖压力)。

第三步:设定界限——纠正关系的“范围”

一些候选关系可能有不正确的范围(例如,“缓震中底”可能被解释为“跑鞋”的组成部分,而不是属性)。该模型通过上下文向量检查边界:

  • “缓震中底”描述了跑鞋的“材料/结构特征”,因此它是一个属性,而不是一个简单的组成部分(如“鞋底”或“鞋面”);因此它被更正为属性关系。

第四阶段:全局校验——结合全文修正错误

该模型生成整个段落的“全局语义向量”(代表整体主题,例如“跑鞋购买指南”),并检查局部关系是否与该主题一致。例如:

  • 如果文本主题是“买跑鞋”,那么“缓震中底”和“减轻膝盖压力”之间的功能使用关系与主题一致。
  • 如果主题是“运动损伤的预防”,则有必要重新评估这种关系是否与"伤害预防"的概念有关。

第五阶段:知识图谱验证——使用结构化知识作为安全网

模型调用知识图谱来检查关系的合理性:

  • 知识图谱中,“跑鞋”属性包括“缓震中底”、“重量”、“外底材质”,确认“缓震中底”是合法属性;
  • 知识图谱中,“缓震中底”的功能包括“减轻膝盖压力”和“提高舒适度”,证实“减轻膝盖压力”是有效功能。

Google 如何确保语义关联的准确性

测试维度 初始精度(2020) 优化后的准确度(2024) 改进方法
常见关系(层级、属性) 78% 88% 新增200万条标注数据,优化BERT微调参数
复杂关系(因果关系、功能用途) 65% 82% 引入“链式推理”(通过中间节点连接遥远的实体)
垂直领域(医学) 60% 79% 特定领域的模型训练(超过 50,000 个带注释的医学文本)
新兴关系(例如“大型人工智能模型 → 多模态”) 52% 75% 结合预训练模型的上下文预测能力,动态识别新的关系

通过组合整个文本来纠正单词的语义偏差

当用户搜索“Python教程”时,Google必须确定页面上的“Python”是表示编程语言(62%)还是蛇(18%)。

如果用户搜索“苹果事件”,则必须确认“苹果”指的是科技公司(95%),而不是水果(5%)。

这种“通过组合整个文本来纠正单词语义偏差”的能力被称为 语境消歧(Contextual Disambiguation)

双向注意力和全局语义

1. 同时“向前看和向后看”的语义捕获

双向注意力机制(BERT 的核心)允许模型同时分析句子的前半部分和后半部分,捕捉单词之间的“因果”关系。

例如,在处理“小明的苹果熟了”这句话时,模型首先关注“小明”和“熟了”,初步推断“苹果”可以表示水果;

但当模型处理下一句“他计划使用 Apple 发布一个新系统”时,会结合之前的上下文并意识到“发布一个新系统”与水果无关,因此将“Apple”的含义更正为“科技公司”。

技术细节:

双向注意力是通过“查询-键-值”矩阵实现的:

  • 查询:当前单词的语义向量;
  • 键:其他词的语义向量;
  • 值:其他单词的语义向量(由注意力系数加权)。

该模型计算“查询”和“键”之间的相似度,为每个单词分配“注意力权重”:权重越高,该单词对当前单词的语义影响越大。

例如,“发布新系统”对“苹果”的注意力权重等于0.8(最高为1),远高于“成熟”相对于“苹果”的0.2,因此模型优先利用“发布新系统”来修正“苹果”的含义。

2. 整个页面的“主题锚点”

除了短语的本地上下文之外,谷歌还为整个页面内容生成一个“全局语义向量”,它代表整体主题(例如“科技产品评论”或“减肥食谱”)。

当单词的局部含义与全局主题发生冲突时,模型会优先纠正与主题一致的含义。

例如,处理标题为“iPhone 15 2025 款防水测试”的页面时:

  • 在本地句子“苹果发布的最新iPhone 15支持卫星通信”中,“苹果”的最初含义可能是“水果”;
  • 但全局语义向量显示该页面的主题是“智能手机评论”,因此模型将“Apple”更正为“科技公司”。

从局部歧义到全局一致的“四个阶段”

我们以“苹果最新发布的iPhone 15支持卫星通信,户外爱好者的福音”内容为例:

第一阶段:局部歧义检测 — 标记“可疑”单词

该模型首先扫描整个文本并识别可能存在歧义的单词(多义词、代词等)。在这种情况下,“Apple”是一个典型的歧义词(水果/科技公司),而“它”是一个需要解决所指对象的代词。

第二阶段:分析本地上下文——提取“候选含义”

对于每个“可疑”单词,模型会分析本地上下文(前后 1-3 个句子)并提取可能的候选含义:

  • “Apple”的候选含义:
    • 候选1:水果(基于“成熟”或“吃”等频繁搭配);
    • 候选2:科技公司(基于“发布iPhone 15”或“卫星通信”等频繁搭配)。
  • “它”的候选含义:
    • 候选1:iPhone 15(参考上一句中的“iPhone 15”);
    • 候选2:卫星通信(参考上一句的“卫星通信功能”)。

第三阶段:全局语义检查——匹配页面主题

该模型生成整个页面的“全局语义向量”(用 BERT 编码完整文本)并计算其与候选含义向量的相似度,选择与总体主题最一致的一个:

  • 标题和正文重复出现“iPhone 15”、“卫星通信”、“户外爱好者”等词语,因此全局语义向量指向“科技产品评论”;
  • “苹果”的候选含义中,“科技公司”与全文主题的相似度(余弦相似度0.85)远高于“水果”(0.12),因此优先选择“科技公司”;
  • “它”的候选含义中,“iPhone 15”与全文主题的相似度(0.9)高于“卫星通信”(0.6),因此更正为“iPhone 15”。

第四阶段:解决冲突——管理多个来源之间的矛盾

如果局部上下文与全局主题发生冲突(例如在句子中“Apple”表示水果,但总体主题是技术),则模型进一步分析冲突的原因:

  • 如果是“笔误”(例如“Apple”应该是“草莓”),则模型保持全局语义;
  • 相反,如果存在“多种含义共存”(例如,该页面同时讨论了苹果水果和苹果公司),则该模型会生成“语义分层”,优先显示与用户查询最相关的含义。

Google 如何确保上下文校正的准确性

测试维度 初始精度(2020) 优化后的准确度(2024) 改进方法
歧义查询(Python) 58% 82% 引入BERT的双向注意力,添加100万条带注释的歧义文本
代词指代修正(“它”) 65% 89% 训练“共指消解模型”(基于超过 100,000 个带注释的句子)
长文本(>5000 个字符) 52% 78% 引入“分段全局向量”(每 500 个字符一个局部全局向量)
跨语言修正(英语 → 中文) 48% 75% 结合多语言BERT模型,添加50万个跨语言对齐标注

NLP 如何确定用户想要什么

谷歌的NLP技术通过分析查询的“意图类型”(信息性/导航性/事务性)、“语义扩展”(隐性需求)和“语境适配”(时间/地点/设备)来确定用户的真实需求。

Google 每天处理超过 85 亿次搜索(2024 年数据)。引入 NLP 后,信息性查询的点击率从 12% 提高到 28%,而通过 BERT 优化,模糊性查询的准确率从 58% 提高到 82%。

意图的类型

1. 信息需求:用户想要“学点东西”

特征词:“如何”、“原理”、“原因”、“教程”等。

示例:如果用户搜索“如何制作手冲咖啡”或“心肌梗塞的原因”,NLP 将匹配教程或科普页面。

支持数据:谷歌2023年内部测试显示,得益于对“如何”等关键词的识别,信息性查询的首屏有效结果百分比从38%提升至72%。

2. 导航需求:用户想要“查找特定站点”

特征词:“官方网站”、“官方”、“登录”、“注册”等。

示例:如果用户搜索“淘宝官网”或“Apple ID 登录”,NLP 会直接将您带到官方网站,而不是第三方页面。

支持数据:微软2024年的研究表明,在导航查询中,由于对“官方”等术语的精确识别,用户点击目标网站的概率从45%增加到89%。

3.交易需求:用户想要“购买商品/服务”

特征词:“推荐”、“便宜”、“折扣”、“购买”等。

示例:如果用户搜索“便宜的机械键盘推荐”或“附近的加油站”,NLP 将优先显示电子商务页面或本地企业。

数据佐证:根据 2024 年 eMarketer 调查,由于 NLP 覆盖了“推荐”、“折扣”等隐性需求,交易查询的转化率从 3.2% 提高到 5.8%。

意图类型对照表:

类型 特征词示例 用户目标 NLP匹配策略
信息型 怎么做,原理,教程 获取知识 结合教程/信息页面
导航 官方网站, 官方, 登录 访问特定站点 直接进入官方网站
交易型 推荐、便宜、折扣、购买 购买商品/服务 优先展示电商页面或本地商家页面

语义扩展

搜索中使用的词语通常只表达中心需求的10%-20%;剩下的80%-90%是隐含的(例如“价格”、“难度”、“使用场景”)。

通过 语义扩展,NLP从中心术语开始延伸相关需求,甚至主动覆盖用户未明确表达的意图。

扩展方式一:按相关词扩展

NLP 基于“Word Embedding”,将中心词与语义相近的词连接起来。例如:

  • 中心术语“减肥食谱” → 相关词“低热量”、“容易制作”、“适合上班族”、“无糖”;
  • 中心术语“下雨时穿什么” → 相关词“防水”、“防滑”、“轻量”、“保暖”。

支持数据:Google 2022 年的 A/B 测试表明,当结果涵盖隐性需求时,用户停留时间从 45 秒增加到 78 秒(+73%)。

扩展模式二:情境化扩展

NLP结合搜索的时间、地点和设备来进一步细化需求。例如:

  • 时间上下文:在冬天搜索“夹克” → 延伸至“填充”、“温暖”;夏天搜索“夹克” → 延伸至“抗紫外线”、“轻薄”;
  • 地理背景:在上海搜索“火锅” → 延伸至“在当地受欢迎”;在成都搜索 → 延伸至“正宗川味”;
  • 设备上下文:从您的智能手机搜索“附近的加油站” → 延伸至“实时燃油价格”、“最近”;从电脑 → 延伸至“用户评论”、“促销”。

支持数据:微软2024年多场景研究表明,情境化扩展后,用户完成任务的时间减少了42%(从移动端的90秒减少到52秒)。

NLP如何“理解”用户需求

1.自然语言理解(NLU)

NLU 是 NLP 的基础:借助分词、实体识别和语义关联的结合,它“分解”了用户的查询。例如:

  • 用户搜索“iPhone 15型号2025防水测试” → 被分词为“2025 型号/iPhone 15/防水测试”;
  • 识别出的实体分别为“TIME(2025)”“PRODUCT(iPhone 15)”“EVENT(防水测试)”;
  • 语义相关性将它们联合在“2025 年 iPhone 15 防水性能测试”中。

支撑数据:根据Google 2023技术博客,复杂查询上的NLU分解准确率达到92%(通用领域)。

2.深度学习模型(如BERT)

BERT 等预训练模型从数万亿文本中学习“上下文语义”,解决歧义问题。例如:

  • 用户搜索“Python” → BERT 解析上下文(如“print() 函数”或“网页抓取教程”) → 将其解释为一种编程语言;
  • 用户搜索“Java” → BERT 结合了“咖啡”和“编程”等相关词 → 将其解释为一种编程语言(62%)或一座岛屿(18%)。

支持数据:谷歌2024年内部测试表明,BERT将歧义查询的准确率从58%提升到82%。

3. 实时上下文数据的集成

NLP 集成了设备时间、地理位置和搜索历史等实时数据,动态调整其对需求的理解。例如:

  • 用户在智能手机上搜索“附近的加油站” → NLP 获取 GPS 位置 → 优先显示半径 3 公里内的加油站;
  • 用户周末搜索“电影票” → NLP结合时间因素(周末) → 推荐热门电影院的电影场次。

支持数据:根据皮尤研究中心 2024 年的一项调查,整合实时上下文数据后,用户对搜索结果的满意度从 68% 跃升至 85%。

真实效果

以下是三种典型场景下的用户行为数据:

场景类型 传统搜索(无 NLP) 使用 NLP 优化搜索 效果提升 数据来源
信息查询(如何做蛋糕) 第一个屏幕混有不相关的广告和教程 第一个屏幕包含带有清晰步骤的教程 停留时间从 45 秒提升至 78 秒(+73%) 2022 年 Google A/B 测试
导航查询(淘宝官网) 首屏第三方购物平台 第一屏只有淘宝官方网站 点击目标网站的概率从45%提升至89% 微软 2024 年研究
事务查询(廉价机械键盘) 第一个屏幕上混杂着昂贵的产品 首屏优先选择性价比最佳机型 转化率从 3.2% 提升至 5.8%(+81%) eMarketer 2024 调查

综上所述,NLP判断用户需求的核心是将“用户输入的词语”转化为“用户的真实意图”。

需要把这些原理用于现有页面,可以接着看NLP 内容优化实操检查:从实体名称、参数条件到标题与段落,逐项确认该改什么。