第二章|生成式 AI 如何读取、拆解和复述你的内容

2.1 AI 看到的内容,和人看到的不是一回事

在进入具体的 GEO 操作之前,有一件事需要先搞清楚:AI 拿到你的页面之后,它「看到」的东西和你在浏览器里看到的并不是一回事。

人在阅读一篇文章时,会快速扫过标题、段落开头和视觉焦点,凭直觉判断这篇文章在讲什么、可不可信、值不值得看完。这个过程快速、整体、模糊——你不需要精确理解每个字,就能对整篇内容形成大致判断。

AI 不是这样工作的。

当一段文本进入模型处理时,第一步是把它拆成一个个很小的文本片段(叫 Token),然后把每个 Token 转化成一组数字(叫向量),再通过数学运算来判断这些数字之间的关系。它的理解不是直觉式的,而是建立在大量计算之上。

打个比方,想象两座不同的图书馆

传统图书馆里,图书管理员用分类标签管理书籍:「历史 > 中国近代史 > 抗战史」。你说出一个关键词,管理员就去对应的书架取书。这更接近传统搜索引擎中更依赖关键词和结构化索引的一面。

现在想象另一种图书馆:没有分类架,每本书被转化成一组坐标,根据它的内容、主题和写作风格放置在一个巨大空间的某个位置。你来查书时,管理员不找关键词,而是把你的问题也转化成坐标,然后找出空间中距离最近的那些书。

这更接近 AI 检索系统中的语义匹配方式(也就是后文要讲的向量检索 / RAG 检索)。它匹配的主要不是字面关键词,而是语义空间里的坐标——并常常和关键词检索、实体识别、结构化字段一起被使用

这个区别对 GEO 有直接含义。无论网页搜索还是生成式回答,让内容被正确抓取、理解并与相关主题建立联系,都是基础工作。分析生成式回答时,还需要观察内容片段能否与用户问题形成稳定匹配,并在后续上下文选择和回答生成中被准确利用。

当然,这两种方式不是泾渭分明的——现代搜索引擎早已广泛使用语义理解,生成式 AI 产品也可能依赖关键词检索、搜索索引和其他检索基础设施。更准确的理解是:词项匹配与语义匹配常常共同存在,具体权重和组合方式因系统而异。

后面几节,我会把 AI 处理内容的关键步骤拆开来讲,不是为了教你变成 AI 工程师,而是为了让你理解:你的内容写成什么样,会直接影响 AI 在每一步中对它的处理结果。

在展开之前,先建立一个简要的框架。你的内容在 AI 系统中大致会经历两个阶段的处理:第一个阶段是检索——AI 需要从海量内容中找到和用户问题相关的候选片段,这个过程通常依赖语义检索、关键词检索、混合检索等多种方式,决定的是你的内容「能不能被找到」(2.2 和 2.3 节对应这个阶段);第二个阶段是生成——AI 拿到候选内容后,理解它、压缩它、用自己的语言重新表述,这个过程决定的是你的内容「怎么被复述」(2.4 和 2.5 节对应这个阶段)。

在实际产品中,这两个阶段可能由不同的模型分别完成,但对内容创作者来说,理解这两步就够了。

图 2-1 内容进入生成式回答的两个阶段:先检索候选,再基于候选生成与复述
图 2-1 内容进入生成式回答的两个阶段:先检索候选,再基于候选生成与复述

2.2 Token 与信息密度:开场白套话正在拖垮内容的检索竞争力

先说结论:你网页上那些「随着 XX 的快速发展」「在当今数字化浪潮下」之类的开场白,不只是对读者的负担——它们会占用段落和切片空间,却没有增加与用户问题相关的事实,在部分检索、重排序和上下文压缩场景中可能降低内容的竞争力。

为什么?要从 AI 处理文字的第一步说起。

AI 处理文字的第一步是把它切割成 Token。Token 是模型能处理的最小单位,不等于字,也不等于词,而是介于两者之间的文本片段。举个例子:以某些常见的分词器为例,中文「新能源汽车购买指南」可能被切成类似 [新能源汽车] [购买] [指南] 这样的片段——具体切分方式因模型而异,但大致规律是:高频词组更容易被保留为整体,低频或生僻的词会被拆得更碎

这个机制有两个直接后果。

第一,Token 数量决定了 AI 一次能处理多少内容。每个 AI 模型都有一个「上下文窗口」的上限——能同时「看到」的 Token 总数。在实际产品中,长页面通常不会被直接整页塞入模型窗口,而是先经过分块、摘要或检索等预处理。Token 与汉字之间不存在固定换算,不同模型和分词器差异很大。这里不需要记忆某个精确比例,只要知道答案块应当短而完整即可:第五章会把页面级主答案块和 FAQ、局部答案块分开给出篇幅建议。

第二,围绕同一意图的信息密度会直接影响检索竞争力。在 RAG 场景里,页面通常会先被切成独立片段,再从这些片段里挑出最值得送进模型的那几个。一个片段的语义信号越集中、越不容易被无关内容稀释,在与用户问题的匹配中就越容易脱颖而出。如果你的答案块里有三分之二是铺垫套话,只有三分之一是有效信息,那么这个片段的语义表示会变得模糊,在与其他候选内容的竞争中很可能处于劣势。

需要强调的是,这里说的信息密度,不是把所有信息塞进一段,而是在同一个问题意图下,减少套话,增加可验证、可复述的有效信息。主题过多、方向过散,反而会削弱片段的语义焦点。

来看一个例子。假设你运营一个家装平台,有一篇「瓷砖选购指南」。以下数字仅为改写示例,不代表真实市场均价。

改造前(低信息密度):

「随着人们生活水平的不断提高,越来越多的消费者开始注重家居品质。瓷砖作为家装中最重要的建材之一,其选择直接影响着整体装修效果和居住体验。那么,面对市面上琳琅满目的瓷砖产品,我们应该如何选择呢?下面为您详细介绍。」

100 个字过去了,几乎没有可用于回答具体问题的有效信息。

改造后(高信息密度):

「家装瓷砖选购的核心指标有三个:吸水率(客厅地砖选低于 0.5% 的全瓷砖,卫生间墙砖选 3%-6% 的釉面砖)、耐磨等级(过道和厨房建议 4 级以上)、规格尺寸(小户型客厅推荐 800×800mm,大户型可选 1200×600mm)。一线品牌全瓷砖参考价约 80–200 元/㎡,二线品牌约 40–80 元/㎡。」

同样 100 个字,包含了更多可被 AI 提取和复述的信息点。

两段话的字数相当,但后者提供了更多与具体问题相关、可以核验和复述的信息。具体系统中的检索结果仍取决于查询、索引和排序方式,但「删掉无效铺垫,尽快进入事实」首先改善了读者体验,也通常更便于机器处理。

2.3 向量与语义匹配:为什么 AI 能找到「意思相近」而非「字面相同」的内容

Token 化之后,模型会先把 Token 转化为数字表示;在后续计算中,这些表示会结合上下文不断更新。到了 RAG 检索场景,真正参与匹配的通常不是单个 Token,而是由专门的嵌入模型(Embedding Model)把整段文本编码得到的段落向量,即一组由数百到数千个数字组成的坐标,代表这段内容在语义空间中的位置。

它们遵循一个核心直觉:意思相近的词、短语、段落,在向量空间中的距离都相近。「装修公司」和「家装服务」虽然字面不同,但在向量空间中的坐标很接近——因为在 AI 的训练数据中,这两个词经常出现在相似的上下文里。

这对 GEO 有四个直接影响:

  • 模糊描述提供的匹配线索有限。「效果很好」「体验流畅」这类泛化表述缺少对象、条件和可验证事实,很难单独支撑具体查询。它们的问题不必归结为向量必然「漂移」,而是信息不足、适用范围不清,也不便于后续核验和复述。
  • 精确术语是检索系统中的「锚点」。「吸水率 0.5%」「耐磨等级 4 级」「800×800mm 规格」——这类精确项更适合作为关键词检索 / BM25 / 实体识别 / 混合检索中的强信号;纯向量检索对精确数字和型号的稳定性反而有限。当用户问「客厅铺什么瓷砖好」时,包含「全瓷砖,吸水率低于 0.5%」的内容会比包含「质量上乘」的内容更容易被召回,也更便于后续生成阶段稳定复述。
  • 同义表达不必在一段里机械堆砌。嵌入模型和现代搜索系统通常能识别不少语义相近的表达,因此不需要把「瓷砖」「墙砖」「地砖」「磁砖」在同一段里并列一遍。更有价值的是按真实场景自然使用准确术语,让不同段落分别回答不同问题,而不是试图人为扩大所谓的「向量面积」。
  • 具体数字比形容词更有采用价值。「价格 80–200 元/㎡」比「价格适中」信息更明确、更可验证、更容易被 AI 直接复述;具体的市场份额数据(如「2025 年市场份额 26%」,示例数据)比「市场份额快速增长」更容易命中具体问题。这也是第六章「数据增强」策略的实践基础。

实战桥接:把上面两节的原理翻译成一次真实的改写

如果你已经开始觉得「Token、向量这些概念离我太远」,别急,下面用一个具体的改写来把前两节串起来。

假设你经营一家教育培训机构,官网首页有这样一段介绍:

原文:

「本机构秉承以学员为本的教育理念,多年来一直致力于为广大学员提供优质的教学服务和良好的学习体验。我们的课程体系完善,师资力量雄厚,深受学员好评。」

从内容角度看,这段文字几乎没有提供课程类型、师资、地点、价格或学习形式等可核验信息,很难回答具体问题。问题的核心不是这些词在向量空间里必然怎样移动,而是它们缺少清晰对象、条件和事实支撑。

改写后(以下数字仅为改写示例,不代表具体机构数据;CPA 通过率引用为业内一般认知,非官方统计):

「课程覆盖 CPA、CFA、税务师等 8 类财会考证,CPA 综合阶段通过率约 62%(全国平均约 20%,为业内一般认知)。在职讲师 47 人,其中注册会计师 31 人、海外持证 9 人。面授班、直播班、录播班三种形式,支持手机和电脑同步学习。北京、上海、杭州设有线下教学点。」

同样篇幅,后者提供了更多可以参与词项匹配、实体识别、语义检索和回答生成的信息。当用户询问课程范围、师资构成或教学地点时,它比前者提供了更直接的回答依据;至于具体检索概率,仍取决于系统实现和其他竞争来源。

记住这个改写背后的逻辑——后面两节讲的注意力机制和自回归生成,会进一步解释为什么「结论前置」和「短句直接」同样重要。

2.4 注意力机制:为什么结论埋太深,AI 往往抓不住

前两节讲的是检索阶段——AI 如何找到你的内容。接下来进入生成阶段——AI 找到你的内容之后,如何理解它、提取关键信息、整合进回答。

当候选内容被送入大语言模型后,模型需要理解 Token 之间的关系——哪个 Token 修饰哪个 Token,哪个数字属于哪个产品,哪句话是结论、哪句话是背景。这个工作由注意力机制(Attention Mechanism)完成。

注意力机制做的事情,可以用一个例子来感受:

句子:「杭州某 CPA 培训机构 2025 年综合阶段通过率达到 62%,在职讲师中注册会计师占比 66%。」

更准确地说,注意力机制不是人工规则式地标注关系,而是在计算中提高相关 Token 之间的权重——让模型更容易把「通过率」和「62%」放在同一语义关系里理解,把「注册会计师」和「66%」关联起来,并识别出「CPA 培训机构」是整句话描述的主体。

但注意力机制有两个特点,对 GEO 有直接影响。

第一个影响因素:代词会增加指代成本。如果上面这句话写成「该机构 2025 年综合阶段通过率达到 62%」,注意力机制需要回溯上文才能确定「该机构」到底指谁。更关键的是,在 RAG 场景中,页面会被切成独立片段——「该机构」的指代对象可能根本不在同一个切片里,AI 连回溯的机会都没有。这就是为什么在答案块和核心段落中,用完整名称替代代词(「它」「该产品」「这款设备」),是成本最低但收效显著的 GEO 动作。

第二个影响因素:结论位置影响内容片段被召回、重排和利用的概率。「结论前置」在 GEO 中重要,有三重原因。

第一,用户更容易快速理解——这和传统写作建议一致。

第二,在 RAG 分块场景中,如果结论埋在文章中段,相关内容被切分后,某些片段可能只包含背景铺垫,缺少对问题的直接回答。这样的片段虽然话题相关,但信息密度不高,在召回和重排序阶段,容易被回答更直接、结构更清楚的竞争内容挤掉。结论前置能让片段更早呈现核心回答,从而提高被选中和被采用的概率。

第三,有研究发现,如 Lost in the Middle(Liu et al., 2023),当多个候选文档被拼接放入模型的上下文窗口时,模型对靠前和靠后位置的信息利用率往往高于中间位置。尽管新一代模型正在缓解这个问题,但它至少提醒我们:内容片段进入上下文窗口之后,最终被放在什么位置,并不完全由内容生产者控制。结论前置不能消除这种位置劣势,但能降低风险:即使片段没有出现在最有利的位置,模型接触到这个片段时,也能更快看到核心回答,而不是先经过一大段背景铺垫。

总结起来:你的核心结论应该出现在页面和段落的前部,而不是藏在长篇铺垫之后。同时,由于 RAG 场景中页面会被切成独立片段,每个关键片段都应当自成一体,不依赖前后文就能独立表达。第五章的答案块工程,本质上就是在利用这些原则。

2.5 AI 怎么把你的内容「说出来」——以及为什么绕口的内容会被跳过

理解了 AI 如何「读」你的内容之后,还有最后一步:它如何把你的内容「说出来」。

AI 生成回答时,不是一次性输出整段话,而是一个 Token 一个 Token 地往外「接龙」——每次产出一个 Token,把它加入已有的上下文,再预测下一个最可能的 Token。这个过程在技术上叫自回归生成。

当然,「接龙」这个比喻偏简化。每生成一个 Token,模型其实都要在一堆候选里做概率判断。但底层怎么算不重要,重要的是:

AI 在复述你的内容时,不是原文拷贝,而是用自己的生成逻辑重新表述

这对内容写作有一个非常具体的影响:如果你的原文结构复杂、句式拗口、逻辑跳跃,AI 在抽取、压缩和改写时的信息损失就会加大——关键信息更容易被丢失或扭曲。反过来,如果你的内容是短句、主动语态、结论前置——AI 复述出来的内容通常更接近你的原意。这就是第六章「易读性」维度的技术根源。易读性不是一个审美偏好,而是一个工程问题:你的内容写成什么句式,直接影响 AI 在复述时的失真程度。

为什么「客观、直接、有数据支撑」更便于核验和复述

除了复述时的信息损失之外,还有一个更底层的原因。

现代大模型在训练后期通常会经过指令微调和偏好对齐,例如 RLHF、DPO 等方法。不同方法的技术路径并不完全一样,目标通常包括提升帮助性、遵循指令和安全性。

不过,不能由此推出「符合某种文风就会被模型优先采用」。从内容工程角度,更稳妥的结论是:客观、直接、有数据支撑的段落更便于读者和系统识别主张、条件与证据,也更容易检查复述是否走样;模糊、浮夸的段落则缺少可核验信息。这里讨论的是信息可用性,不是某个对齐算法对外部网页的公开评分规则。

关于「温度」参数

在自回归生成中,「温度」(Temperature)会改变候选 Token 概率分布的集中程度。较低温度通常使输出更集中和稳定,较高温度通常增加多样性;实际结果还受采样方法、系统设置和解码策略影响。

外部用户通常无法知道产品实际使用的温度和解码设置。即使内容在检索阶段进入候选,最终是否被采用、如何表述,仍可能受到模型版本、候选来源、上下文组织和产品策略等因素影响。因此,GEO 适合用重复测试观察概率变化,不适合把单次结果解释成确定规则。

2.6 本章最重要的一条铁律:让每个 Token 都承载有效信息

当然,信息不是靠单个 Token 承载的——语义产生于 Token 的组合和上下文。但这条铁律要传达的意思是:你的内容中每一段文字都应该承载有效信息,不要把宝贵的篇幅浪费在无用的铺垫上。

回顾一下 AI 处理你的内容的两个阶段:

检索阶段: 你的页面被切成片段 → 每个片段被编码成向量 → 与用户问题的向量比较距离 → 选出最相关的候选片段

生成阶段: 候选片段被送入大语言模型 → 模型通过注意力机制理解 Token 之间的关系 → 用自回归方式生成回答

在这两个阶段中,AI 都在做同一件事:

把你的内容拆解成更小的单元,然后决定如何重新组合

由此引出本章最核心的判断:在 GEO 时代,内容的竞争力不在于「写了多少」,而在于「被拆解和重组后还能保持多少信息密度」

一篇三千字的文章,如果核心结论埋在第八段、关键数据散落在不同小节、主语全用代词、句式又长又绕——AI 在每一步处理中都会损失信息。切片质量低,向量锚点不精准,注意力分散,复述失真。最终结果是:内容虽然存在,但被检索和采用的概率都会降低。

反过来,一篇只有六百字的页面,如果开头就是清晰的结论,核心数据带来源和单位,每段话自成一体、不依赖上下文就能独立表达——AI 在每一步处理中都能高效提取信息。切片质量高,向量精准,注意力集中,复述流畅。

后续章节里的那些实操动作——页面级主答案块控制在约 200—400 个中文汉字,FAQ 或局部答案块通常控制在约 100—200 个中文汉字,结论前置、代词换成完整名称、数据带来源和单位、句式尽量短而直接——背后基本都能在 AI 处理内容的机制里找到原因,也会在后续章节结合测试和案例继续展开。以上长度都是经验参考区间,不是平台规范。理解了这些机制,你就不只是在「照着清单做」,而是真的知道「为什么要这么做」

这种理解,在 AI 产品不断迭代、操作细节不断变化的背景下,比任何一份具体的操作清单都走得更远。

需要补充说明的是:为了便于理解,本章把大语言模型处理文本和 AI 搜索 / RAG 系统处理网页内容放在同一条认知链路中讲。严格说,网页抓取、正文抽取、分块、向量检索和模型生成并不总是由同一个模型完成——很多产品会使用独立的检索模型、嵌入模型和生成模型。本章关心的不是具体系统架构,而是这些机制共同指向的一件事:内容越清晰、密度越高、结构越独立,越容易被检索、理解和复述。

延伸阅读

以下三篇文献是本书技术讨论中反复涉及的基础研究。如果你对底层原理感兴趣,可以作为进一步阅读的起点:

  • Lewis et al.(2020):Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks,NeurIPS 2020。较早系统提出并命名 RAG 模型,是理解第三章讨论的外部检索通道的重要基础。
  • Karpukhin et al.(2020):Dense Passage Retrieval for Open-Domain Question Answering,EMNLP 2020。在开放域问答任务中证明,稠密向量检索可以超过强 BM25 检索基线,对理解第六章相关性议题中的检索机制有重要参考价值。
  • Aggarwal et al.:GEO: Generative Engine Optimization。2023 年发布 arXiv 预印本(2311.09735),后正式发表于 KDD 2024。该研究较早系统提出并讨论 GEO 概念和生成式引擎可见性优化框架,其研究结论与本书第六章讨论的内容优化维度有较多呼应。

本章执行清单

这一章偏底层认知,但有两个动作现在就可以做:

  • 替换代词。 打开你最重要的 3 个页面,搜索「它」「这款」「该产品」「该设备」,逐一替换为完整名称。这是成本最低的 GEO 改善动作之一。
  • 检查信息密度。 算一算核心答案段落里,有多少字是有效信息(数据、结论、事实),有多少字是铺垫和套话。套话超过三分之一,这个段落在检索排序中很可能竞争不过信息更密实的竞品内容。