把模型当成会变化的基础设施
模型密集发布容易带来一种错觉:只要换成能力更强的模型,搜索质量就会自然提高。
真实项目通常不是这样。企业搜索答错问题,原因往往出在更靠前的位置,例如文档过期、产品名称不统一、权限继承错误,或者检索阶段根本没有找到正确材料。模型只能处理拿到的上下文,不能替企业补齐缺失的事实。
因此,模型层最好通过统一接口接入。业务系统提交任务,由路由层决定调用哪个模型;模型更换时,知识库、检索规则和业务流程不必一起重做。
评估也应与具体模型分开。企业需要一组固定问题,长期记录答案准确率、引用完整性、响应时间和单次成本。新模型上线前先跑同一套测试,再决定是否替换。发布会上的跑分无法代替企业自己的问题集。
算力分化要求任务分级
企业面对的算力选择已经不只是“公有云还是本地部署”。实际组合可能包括海外模型API、国内云服务、国产算力集群、私有推理节点和端侧模型。
这些方案各有边界。高能力模型适合处理复杂研究、长文档归纳和多步骤推理,但成本高,等待时间也可能更长。小模型更适合分类、关键词提取、意图识别和固定格式生成。涉及敏感数据的任务,还要考虑数据是否允许离开指定环境。
没有必要让每个问题都调用最强模型。一个售后问题如果能从结构化知识库直接返回,继续增加推理开销没有实际收益。
更稳妥的办法是按任务分级:
- 事实查询优先走检索和规则校验;
- 归纳比较交给通用模型;
- 高风险回答增加证据核对和人工确认;
- 涉及商业秘密或个人信息的任务进入私有环境;
- 服务异常时切换备用模型,或者退回传统站内搜索。
算力规划由此变成一套可执行的路由规则,而不是一次性的供应商选择。
AI搜索应拆成四层
企业级AI搜索至少包含四层,它们解决的问题并不相同。
第一层是信息源。产品资料、技术文件、政策说明、合同条款和服务记录必须有明确负责人、更新时间和适用范围。旧文件不能与当前版本混在一起。
第二层是检索。系统要根据问题类型选择关键词检索、向量检索、知识图谱或数据库查询。召回内容过多会制造噪声,召回不足则会迫使模型猜测。
第三层是回答。模型负责组织语言、解释关系和标注不确定性。它不应修改原始事实,也不应在缺少依据时自行补全数字。
第四层是评估。企业需要知道系统引用了什么、漏掉了什么、哪些问题经常失败,以及用户是否继续追问或转向人工渠道。
这四层中,模型只占一层。很多项目却把大部分预算花在模型接入上,知识整理和长期评估反而没人负责。上线初期看不出问题,使用量一上来,错误就会集中暴露。
官网应成为可核验的信息源
AI搜索正在改变官网的作用。过去,官网主要服务浏览和转化;现在,它还要让搜索引擎、问答系统和智能体准确识别企业是谁、提供什么,以及某项说法依据什么。
这不等于把文章切成大量短段,或者堆出一批所谓“AI友好页面”。Google在生成式搜索优化指南中明确建议继续做好基础SEO、技术结构和原创内容,并提醒网站不要迷信机械分块、无必要的AI文本文件或批量页面等“GEO技巧”。
官网更需要补齐的是事实结构:
- 公司、品牌、产品与业务主体使用统一名称;
- 规格、适用范围和更新时间写清楚;
- 数据附带来源、统计周期与计算口径;
- 作者、审核人和发布日期可以识别;
- 页面之间存在清楚的引用关系;
- 重要信息保留为可抓取文本,不只放在图片或PDF里。
一篇文章能否被AI引用,首先取决于它是否提供了可以核对的内容。如果整篇只有观点,没有证据,模型很难把它当作稳定来源。
GEO不能只统计品牌出现次数
一些企业已经开始监测品牌在不同AI答案中的提及、引用和竞品对比。Adobe推出的Brand Visibility也把这些指标与内容分析、优化动作放入同一流程,说明GEO正在进入企业软件体系。
但品牌被提到,并不等于回答正确。
我更建议把“可验证回答率”设为主要指标:在一组与业务有关的真实问题中,有多少答案准确引用了企业材料,并且没有遗漏适用条件。
在此基础上,再看引用覆盖率、错误陈述率、竞品替代率、来源页面分布和后续访问。这样才能判断问题出在内容缺失、检索失败,还是模型理解偏差。
单纯追求提及次数,容易把团队带回关键词堆积。最后品牌出现得更多,错误也跟着增加。
合规要求必须进入内容流程
AI搜索会同时处理公开网页、内部文档和用户输入。数据来源、访问权限、内容标识及日志留存不能等到上线后再补。
我国《人工智能生成合成内容标识办法》已经对文本、图片、音频、视频等生成合成内容的显式与隐式标识作出要求,并于2025年9月1日起施行。
企业因此需要记录一段内容由谁提交、是否经过AI处理、谁完成审核、何时发布。对于内部搜索,还要保留检索文档、模型版本、权限判断和回答结果。出现争议时,团队应能还原系统当时看到了什么。
这些记录看起来繁琐,却能直接减少合规调查和错误追踪的时间。

企业现在可以做什么
我建议先用九十天完成一个小范围闭环。
前两周梳理高频问题和信息源,找出名称冲突、过期页面和无人维护的文件。接着选择一个边界清楚的业务场景,例如产品选型、售后支持或内部制度查询,建立测试问题和正确答案。
随后接入两到三种能力、成本或部署方式不同的模型。所有模型使用同一套知识源和评估方法,比较准确率、引用质量、响应时间及成本。结果不理想时,先检查检索与材料,再考虑换模型。
最后,把测试中反复缺失的内容补回官网或内部知识库。每次更新都标明负责人、日期和适用范围。这样形成的资产可以继续服务传统搜索、AI问答、客服和销售,不会随着某个模型停用而失效。
结语
模型仍会快速变化,算力供应也会继续分化。企业无法提前确定哪种模型会长期领先,但可以把系统设计成允许替换、能够降级、保留记录。
AI搜索布局的长期价值,来自一套干净、可检索、可引用、可追责的信息体系。模型负责生成答案,企业负责保证答案有东西可查。
