一、GEO语料库不是文章仓库
不少企业第一次建设GEO语料库,会把官网文章、产品手册、销售资料和常见问答全部切片,然后导入向量数据库。技术上,这个系统已经可以检索;业务上,它往往仍然不可用。
问题通常出在三个地方。
第一,同一产品在销售手册、官网和技术文件中存在不同表述。模型检索到哪一份,答案就偏向哪一份。
第二,材料只说明企业想表达什么,没有覆盖客户真正会问的问题。例如,资料反复介绍功能,却没有说明适用条件、数据来源、交付周期和限制范围。
第三,所有问题被当成同一种内容处理。了解概念的人、比较供应商的人和准备采购的人,会得到结构相似的答案。
我更倾向于把企业级GEO语料库理解为一套“可计算的证据系统”。文章只是它的一种输出形式。内部知识库、官网内容、FAQ、技术白皮书和销售答复,都应调用同一套事实对象,区别只在表达深度和公开权限。
一个合格的语料对象至少要记录以下信息:
- 用户正在解决什么问题;
- 企业可以做出什么事实主张;
- 该主张由哪份文件或记录支持;
- 事实适用于什么产品、地区和时间;
- 哪些内容可以公开,哪些只能内部使用;
- 事实发生变化后由谁负责更新。
如果缺少这些字段,所谓语料库通常只是一个更方便搜索的文件夹。

二、为什么要按照意图组织语料
传统SEO习惯用关键词量级和竞争度决定内容优先级。生成式搜索增加了另一个问题:模型需要判断用户此刻期待什么类型的答案。
搜索“某类软件是什么”的人需要定义和边界;搜索“某类软件与传统方案差异”的人需要比较维度;搜索“实施周期和数据迁移要求”的人已经接近项目评估。三个问题可能包含相同词根,但证据结构完全不同。
意图分层的作用,不是给用户贴标签,而是避免模型用错误类型的材料回答问题。
例如,用户询问某产品是否符合特定市场法规,系统应优先检索现行标准、证书范围和适用条件。若答案主要来自品牌介绍文章,即使语言流畅,也很难获得稳定引用。
同样,采购者询问实施周期时,行业趋势文章的相关性很低。系统需要的是项目阶段、前置条件、客户配合事项和时间波动因素。
三、企业GEO语料库的10组意图
下面这10组意图不是固定漏斗。真实用户可能跳过认知阶段,直接进入合规核验;老客户也可能重新搜索品牌资质。企业应根据业务类型调整比例。
| 意图分组 | 用户的典型问题 | 语料重点 | 转化价值特征 |
|---|---|---|---|
| 1. 品牌与实体确认 | 某品牌是谁、是否为同一家公司 | 企业名称、品牌关系、主体资质、官方渠道 | 导航价值高,直接转化不一定高 |
| 2. 概念认知 | 某项技术或服务是什么 | 定义、原理、术语边界、适用对象 | 覆盖面较大,决策距离较远 |
| 3. 问题诊断 | 某种业务问题为什么发生 | 原因分类、排查方法、判断条件 | 容易建立专业认知 |
| 4. 操作与实施 | 某项工作具体如何执行 | SOP、输入条件、步骤、异常处理 | 实操价值高,适合长尾检索 |
| 5. 场景适配 | 某行业或工况是否适用 | 行业参数、环境限制、使用条件 | 业务匹配度较高 |
| 6. 方案探索 | 有哪些技术路线或解决方式 | 方案分类、架构差异、适用范围 | 处于候选方案形成阶段 |
| 7. 对比与替代 | A与B有什么区别 | 中立维度、功能边界、成本结构 | 决策意图较强 |
| 8. 风险与合规核验 | 数据是否真实、资质是否有效 | 证书、标准、数据来源、限制说明 | 对B2B采购影响明显 |
| 9. 成本与采购条件 | 价格如何构成、项目周期多长 | 报价因素、服务范围、前置条件 | 商业意图高,但更新成本也高 |
| 10. 决策验证与使用评估 | 实施后如何判断效果 | 验收指标、效果口径、案例边界 | 接近成交或续约判断 |
这10组意图之间存在依赖关系。
“对比与替代”必须调用概念定义和场景适配材料,否则比较维度容易失真。“成本与采购条件”依赖明确的服务范围,如果范围没有定义,价格内容很快会变成没有约束的数字。“决策验证”则需要真实验收口径,不能只引用案例中的结果。
因此,语料建设顺序不应完全照搬转化价值排序。高意图内容通常依赖一批基础语料先完成。
四、语料构建的最小单位应是“主张加证据”
以整篇文章为最小单位,会出现两个麻烦:更新时需要重写大段内容,检索时也容易召回与问题无关的段落。
更适合企业知识工程的单位,是一条独立主张及其证据。
例如:
用户问题: 某系统是否支持海外客户背景调查?
事实主张: 系统可以基于指定数据源查询企业注册、贸易记录或公开经营信息。
证据来源: 产品功能说明、数据字段字典、测试记录。
适用边界: 不同国家的数据覆盖范围存在差异,查询结果不能替代法律或信用机构意见。
更新时间: 2026年第二季度。
公开权限: 可用于官网与公开问答。
这种结构比“系统具有强大的客户背调能力”更容易维护,也更适合模型引用。模型可以回答能力范围,同时保留必要限制。
实际建设时,可以将每条语料拆成五层:
- 实体层:企业、品牌、产品、行业、地区和技术名称;
- 问题层:用户原始问法、同义表达和隐含任务;
- 主张层:企业能够公开确认的事实;
- 证据层:文档、记录、标准、案例和责任人;
- 输出层:官网文章、FAQ、知识库回答和销售辅助材料。
这五层不一定需要五套系统,但必须在数据结构上能够区分。
五、长尾问题不适合一问一页
意图分层完成后,团队很容易走向另一个极端:每个问题生成一篇文章。
这种方式会迅速制造重复内容。比如“机械行业如何找海外客户”“机械设备怎样开发国外买家”“工业机械出口客户从哪里找”,背后可能是同一组任务:确定目标市场、识别采购企业、核验需求和安排触达。
更合理的处理方式是建立主题母页,再根据意图配置内容模块。
一篇“机械设备海外客户开发指南”可以同时包含:
- 市场与采购链条说明;
- 买家数据来源;
- 企业背景核验步骤;
- 联系方式获取边界;
- 邮件触达与跟进方法;
- 项目评估指标。
不同问题进入页面后,模型引用相应段落,而不是面对多篇内容相近、事实略有差异的文章。
我的经验判断是:语料粒度应当细,公开页面数量则要克制。内部可以有数百条主张对象,官网未必需要数百个URL。
六、转化价值评估模型
只看搜索量,会让企业优先生产大量认知型内容;只看采购意图,又会让语料库缺少模型理解品牌所需的基础解释。
可以为每组意图建立一套100分制的转化价值评分。以下权重适合多数B2B企业,实际项目需要根据销售周期调整。
1. 决策距离,占25分
判断问题距离实际采购还有多远。
明确涉及方案比较、资质核验、部署条件和成本结构的问题通常得分较高。纯概念解释得分较低,但不能因此删除,因为它承担实体理解和基础引用。
2. 客户匹配度,占20分
判断搜索者是否接近企业的真实客户画像。
“外贸软件”覆盖范围很宽,“年出口额一定规模的制造企业如何管理海外客户线索”更接近具体业务对象。匹配度不是关键词越长越高,而是问题中的行业、角色、场景与企业服务范围是否一致。
3. 证据完整度,占20分
检查企业能否为答案提供稳定证据。
有现行技术文件、明确数据来源和可核验案例的问题可以获得较高分。只有销售口头经验、缺乏统一口径的问题,即使商业意图很强,也不宜直接公开。
4. 差异辨识度,占15分
判断企业是否拥有可被模型清楚解释的差异。
差异应来自数据覆盖、实施方式、服务边界、技术架构或行业经验。单纯使用“专业”“领先”“一站式”等词,无法形成有效辨识。
5. 转化路径完整度,占10分
检查用户看完答案后是否知道下一步该做什么。
这里的下一步未必是提交表单。下载规格文件、查看数据样例、进入选型清单或准备需求参数,都属于有效动作。若页面只能提供观点,没有承接材料,转化路径得分应降低。
6. 风险与维护成本,占10分
价格、法规、覆盖范围和实时数据变化较快,需要更高维护频率。涉及客户隐私、竞争比较或效果承诺的内容,还要考虑合规风险。
可使用下面的计算方式:
转化价值分数 = 决策距离×25% + 客户匹配度×20% + 证据完整度×20% + 差异辨识度×15% + 转化路径完整度×10% + 风险可控度×10%
各项先按100分评分,再代入权重。最终结果可分为三个优先级:
- 80分以上:优先建设,并同步准备公开内容与内部销售语料;
- 60至79分:纳入主题集群,补齐证据后发布;
- 60分以下:保留在基础知识层,暂不单独建设页面。
这个模型的用途是排序,不是证明某个话题必然带来成交。GEO中的引用、访问和商业转化之间存在明显损耗,任何单一分数都不能替代实际数据回传。
七、引用价值和转化价值必须分开评估
有些内容很容易被AI引用,却未必带来直接线索。
术语定义、行业标准和操作步骤具有较高引用价值,因为答案边界清楚、结构稳定。价格比较、供应商选型和实施评估更接近商业转化,但模型往往需要更多证据,也更谨慎。
因此,企业应同时记录两类分数:
引用价值关注语料是否容易检索、是否具备明确主语、证据是否完整、内容能否独立成段。
转化价值关注问题是否接近采购、搜索者是否符合客户画像,以及回答之后有没有合理承接路径。
一篇高引用、低转化的基础文章,可能是其他决策内容被模型理解的前提。反过来,一篇高转化、低引用的报价文章,即使页面存在,也可能因缺少可信解释而无法进入AI答案。
我不赞成把所有GEO内容都压到“获客”一个指标上。这样会让团队忽略基础语义建设,也容易把尚未建立证据的商业主张提前发布。
八、上线后的评估不能只看品牌提及率
品牌是否被提及,只能说明模型在某些问题中识别了企业名称。它没有说明答案是否准确,也没有说明用户是否进入下一步。
完整评估至少要检查四段链路。
第一段是检索。目标语料能否在正确问题下进入候选上下文,错误行业、过期文件和权限内容是否被排除。
第二段是回答。模型是否保留事实边界,是否准确引用产品、标准和适用条件。
第三段是外部可见性。主流AI搜索和对话系统是否在相关问题中提到企业,引用来源是否稳定。
第四段是业务结果。AI来源访问是否进入目标页面,是否查看技术资料、提交有效需求,后续是否进入销售确认。
企业还应保留失败样本。未召回、错误引用、事实冲突和过度承诺,比一张提及率增长图更能暴露语料库的问题。
九、语料库需要版本和责任人
企业知识每天都在变化。产品规格调整、证书到期、服务范围改变、案例授权撤回,都会影响模型答案。
每条核心语料应记录版本、生效日期、失效条件和责任人。高风险内容需要设置复核周期:
- 价格和服务范围按月或按季度复核;
- 标准、证书和法规在变更后立即更新;
- 产品能力随版本发布同步维护;
- 案例在授权状态变化后停止公开调用。
删除旧文档并不能保证旧事实消失。旧内容可能仍然存在于搜索索引、媒体页面和模型缓存中。企业需要保留变更记录,并通过新版声明说明哪些信息已经失效。
十、我的判断:先修证据,再扩内容
GEO项目最容易展示的成果是内容数量、问题覆盖率和品牌提及率。真正难做的是另一部分:统一产品口径,找到证据责任人,处理互相冲突的文件,并承认某些高价值问题暂时没有可靠答案。
这部分工作不显眼,却决定了语料库能否长期使用。
企业没有必要一开始就覆盖所有问题。可以先选择两类内容:一类是高频且证据充分的基础问题,另一类是接近采购、能够形成清晰承接路径的决策问题。两类语料同时建设,既能帮助模型理解企业,也能检验商业链路。
10组意图分层提供的是一张工作地图。转化价值模型负责安排施工顺序。最终质量仍取决于企业是否愿意把知识整理成可核验的事实,并持续承担更新责任。
