第03章|GEO Epistemology(GEO认识论):我们能知道什么,不能知道什么

一、黑箱条件下的研究对象

GEO(Generative Engine Optimization,生成式引擎优化)面对的是一个Partially Observable Black-box Answer System(部分可观测的黑箱答案系统)。我们可以向人工智能提交问题,保存输入和输出,观察显示引用、可见工具调用、实体提及、比较方式、推荐条件和边界表达;但在通常情况下,我们不能直接查看模型参数、内部来源权重、完整候选集合、隐藏上下文、训练记忆、重排过程和全部生成路径。

这产生了两种方向相反、但同样危险的错误。第一种错误是过度确定:看到某篇文章被引用,就断言“这个平台权重高”;看到品牌出现频率上升,就断言“人工智能已经建立品牌认知”;看到干预前后答案不同,就断言“这次发布改变了模型”。第二种错误是过度悲观:因为无法查看内部机制,就认为GEO(生成式引擎优化)无法研究、无法测量,只能凭经验发内容。研究的关键不是假装拥有全知视角,而是明确什么被观察到了、观察是否完整、如何编码、结论属于哪种命题、因果支持到了哪一级,以及它只在哪些条件下成立。

因此,GEO(生成式引擎优化)认识论要解决的问题不是“如何猜中人工智能的秘密”,而是:在内部机制无法被完整观察的条件下,如何产生可检查、可复核、可证伪、可限定范围并能够逐步升级的知识。

研究对象是答案行为,不是内部心理。人工智能会使用“我认为”“我推荐”“根据这些来源”等拟人化表达,但这些语言不能被当成系统内部心理状态的直接报告;显示“已搜索”也只能证明界面呈现了某种工具调用迹象,不能证明我们已经获得完整的Retrieval Set(检索集合)。本书因此把Conditional AI Answer Behavior(条件化人工智能答案行为)作为当前主要Observation Object(观测对象)。所谓“条件化”,是指任何答案记录都必须放回它产生时的条件中:使用了什么查询、哪个引擎和产品入口、什么时间、哪种账户与会话状态、是否发生工具调用、是否存在已知用户上下文,以及该次运行处于基线还是干预后阶段。

我们可以陈述“在已记录的引擎、时间、查询、会话和工具条件下,答案提到了甲企业,并显示引用乙页面;答案使用了‘适合小微企业’这一理由,同时保留了地域限制”,却不能仅凭该记录陈述“人工智能信任甲企业;乙页面拥有固定高权重;模型已经把甲企业写入长期记忆;系统内部先从固定候选池筛选,再按统一规则排序”。前一句是Answer-level Observation(答案层观测),后一句是未经支持的Latent Mechanism Claim(潜在机制命题)。这条边界贯穿本书后续所有诊断、干预和测量。五层研究框架与五类对象、观测键的完整界定见第1章第四节和第2章第四节。

二、五轴认识标注:一项结论不能只写“置信度高”

一个模糊的Confidence Score(置信分数)很容易把不同性质的不确定性揉成一个数字。本书不采用这种伪精确表达,而要求重要结论至少沿五个轴分别标注:

Epistemic Status(认识状态)
× Observability(可观测性)
× Claim Mode(命题性质)
× Causal Confidence(因果置信度)
× Scope(适用范围)

1. Epistemic Status(认识状态):它目前处于什么知识阶段

状态 含义 允许的使用方式
Accepted(已接受) 当前项目已接受的定义、边界或方法规则 可作为当前工作依据,但不自动等于自然规律或完整机制已被证明
Operational Hypothesis(操作性假设) 有理由提出、可指导登记实验,但尚未完成验证 必须与干预、预期观察和检验条件绑定,不得包装成已证实因果
Validated Pattern(已验证模式) 按预定义口径获得充分、可审查的重复支持并通过正式准入 只能在登记的适用范围内使用;当前正式登记为空
Rejected(已否定) 已被当前体系明确否定的通用说法或方法 只能作为反例或历史决策保留,不得重新包装后恢复
Unknown(未知) 当前证据或观测能力不足 只能作为研究问题,不得由Agent(智能体)或服务人员自行补全
Draft(草案) 尚未完成正式审查的新定义或结构 可讨论和测试,不得冒充正式基线

Accepted(已接受)不等于“已经证明人工智能就是这样运行”。例如,“单次回答不能代表稳定总体结论”是一项已接受的方法边界,它并不声称我们掌握了所有答案波动的内部原因。

2. Observability(可观测性):它是看到的、编码的,还是不可见的

本书把可观测性分为三类:Direct Observation(直接观测,可检查的原始输入、完整输出、显示引用、可见工具轨迹、页面状态、时间戳和正式业务记录);Coded Inference(编码推断,依据Codebook(编码手册)对决策变量、实体归属、引用吸收、命题—证据一致性、推荐强度和边界表达作出的规则化判断);Latent or Unknown(潜在或未知,模型内部权重、隐藏上下文、完整候选集合、训练记忆、不可见生成路径和无法识别的个性化影响)。

直接观测与编码推断都可以成为严肃研究材料,但两者必须分开保存。答案原文是直接观测;“该答案把价格作为首要Decision Variable(决策变量)”是编码推断,后者需要规则、版本、编码者和争议记录。

3. Claim Mode(命题性质):我们究竟在说哪一类话

  • Descriptive Claim(描述性命题):记录发生了什么,例如“10次合格运行中有4次提及该实体”;
  • Relational Assessment(关系性评估):判断两个对象之间是否匹配,例如“显示引用是否支持答案中的具体命题”;
  • Associational Inference(关联性推断):陈述两个变化共同出现,但不宣称因果;
  • Causal Claim(因果命题):声称某项干预导致了某种变化,需要更严格设计;
  • Normative Constraint(规范性约束):规定什么应当或不得做,例如真实性、隐私与非欺骗;
  • Methodological Rule(方法论规则):规定研究如何记录、复核和升级结论。

“内容必须真实”是一项Normative Constraint(规范性约束),不能据此推导“人工智能算法必然偏好真实内容”这一Empirical Mechanism Claim(经验机制命题)。前者是服务底线,后者需要独立证据。

4. Causal Confidence(因果置信度):因果支持到了哪一步

本书沿用C0—C5因果置信结构:

等级 当前含义 不允许的越级解释
C0(无法判断) 现有设计无法判断因果方向 不得把前后差异解释为干预效果
C1(方向信号) 出现与预期一致的变化信号 不等于干预导致变化
C2(对照支持) 合格对照提高了因果解释的可信度 污染、外部事件和测量变化仍需检查
C3(重复支持) 在明确的时间、样本、查询、批次或环境维度获得结构化重复 重复次数本身不等于独立支持
C4(跨批复现) 暂定为更强的跨批复现 正式准入标准仍为Unknown(未知),不得自行授予
C5(强经验规律) 暂定为最高级经验支持 正式准入标准仍为Unknown(未知),项目团队不得自行宣称

等级不会因为运行次数自动上升。同一会话在同一天连续运行100次,可能提高对该测量环境的描述精度,但不会自动成为Independent Replication(独立复现)。任何等级也都不等于已经发现模型内部机制。

5. Scope(适用范围):结论在哪些条件下成立

至少需要绑定Entity(实体)、Decision Situation(决策情境)、Query Cluster(查询簇)、Functional Probe(功能性探针)、Paraphrase(同义改写)、Run(运行轮次)、Engine(引擎)、Time(时间)、Experiment Phase(实验阶段)和Known User Context(已知用户上下文,如适用)。“某企业在一次问答中被推荐”不能扩展成“该企业在人工智能中拥有良好表现”;一个引擎、一个地区、一个时间窗口中的结果,也不能静默外推到所有人工智能产品和真实用户环境。

三、采集完整性与缺失分类

“直接看到”并不意味着记录链天然完整。假设一张截图显示人工智能推荐某企业,但下半部分被裁掉,而被裁掉的内容包含“不适用于跨境业务”的重大限制。截图中的文字确实是Direct Observation(直接观测),但这张截图不能代表完整答案,也不能支持“无条件推荐”的编码。

每次人工智能观测至少应保存原始查询和尽可能完整的原始输出、Engine(引擎)或模型产品版本、时间地区账户会话状态与已知系统条件、采集渠道或界面、截断折叠流式中断与安全拦截状态、显示引用与工具调用、原始记录指纹或其他完整性校验,以及Capture Completeness(采集完整性)和Not Observable(不可观测)字段。截图、摘要和人工转录可以用于展示,却只能作为Derived Material(派生材料),不能在没有说明的情况下替代完整原始记录。

一次运行没有得到可编码的实体提及,可能存在完全不同的原因:No Mention(未提及)、Refusal(拒答)、Timeout(超时)、Tool Failure(工具失败)、Parse Failure(解析失败)、Truncated(截断)、Safety Block(安全拦截)、Not Observable(不可观测)或Missing for Unknown Reason(未知原因缺失)。如果把超时、拒答和解析失败全部记成“未提及”,人工智能表现会被系统性低估;如果只删除失败运行,结果又可能被系统性美化。因此,缺失必须保留分类,并报告原始分母、合格分母和处理规则。没有分母纪律的百分比,即使计算正确,也可能没有可解释性。

四、编码治理与自动编码器

人工智能答案通常不是天然结构化数据。研究者需要判断“可以考虑”是否属于推荐,引用是否真的支持相邻命题,限制条件是否足以改变适配状态。这样的判断属于Coded Inference(编码推断),必须依赖版本化的Codebook(编码手册)。一份合格的编码手册至少应包含Atomic Claim(原子命题)和Decision Variable(决策变量)的定义、正例反例与边界Anchor Example(锚定样例)、包含规则与排除规则、缺失和不可观测的处理方式、冲突多标签与裁决规则,以及Codebook Version(编码手册版本)和变更记录。

两名编码者都把“资料来源中包括甲公司”判定为“人工智能推荐甲公司”,他们可能获得很高的Agreement Rate(编码一致率),但共同使用了错误规则。Agreement(编码一致)只说明判断相似,不证明Code Validity(编码有效性),也不证明相关命题真实。高一致率也可能来自类别极不平衡,例如95%的答案都没有实体,两名编码者全部选择“未出现”。因此,一致性需要结合类别分布、混淆矩阵、主要分歧类型以及裁决前后结果解释。必要时可以使用Cohen's Kappa(科恩卡帕系数)或Krippendorff's Alpha(克里彭多夫阿尔法系数),但本书不设置未经验证的通用阈值。

自动编码模型可能把“可以考虑”稳定地判断成强推荐,也可能在模型版本更新后改变标准。因此,Automated Coder(自动编码器)必须像其他测量工具一样接受治理,至少记录模型版本与提供方、System Prompt(系统提示)与编码提示、采样设置、输入预处理与输出解析方式、校准集盲样与主要错误类型、人工独立复核样本、Coder Drift(编码器漂移)以及工具变更后是否需要重新编码。“人工点击确认”不等于Independent Review(独立复核);如果复核者先看到自动编码结果并几乎全部接受,就可能发生Automation Anchoring(自动化锚定)。在可行条件下,应让复核者先独立判断,再查看自动结果;高风险、争议、因果与合规结论还需要相应专业人员复核。

五、参照标准也可能冲突

GEO不是只研究人工智能答案,还要判断企业事实、资格和证据状态。但所谓Reference Standard(参照标准)也不一定永远单一、同步和无争议。例如,企业称许可证已经续期,官方数据库仍显示过期,而企业可以提供续期申请受理回执。此时不能粗暴选择“相信企业”或“相信数据库”,正确做法是把复合陈述拆成不同Atomic Claim(原子命题):申请是否提交、是否受理、是否正式批准、许可当前是否有效、公开数据库是否完成更新。

发生冲突时,应当拆分复合命题,分别记录来源、时间、范围、授权和证明功能,区分申请、受理、批准、生效和公开更新等状态,同时保留支持证据、限制证据与反向证据,必要时标记Contested(存在争议)或Indeterminate(无法判断),并保存裁决理由与复查日期。Reference Standard(参照标准)是当前判断所依据的可审查标准,不是可以免于质疑的绝对真相。企业是命题的受益方,可以补充事实和提出Appeal(申诉),但不能静默覆盖不利结论。

六、重复测量、独立性与因果升级

生成式人工智能具有波动性,因此重复测量是必要的。但“重复”不是简单增加运行按钮的点击次数。每个测量批次需要记录新会话还是连续会话、账户地区设备与产品入口是否相同、缓存历史上下文与个性化是否可能延续、查询来自真实用户还是人工智能生成,以及Measurement Environment(测量环境)与Target Use Environment(目标使用环境)之间有何差异。同义问法也不天然代表用户多样性:如果所有Paraphrase(同义改写)都由同一个模型生成,它们可能表面不同却共享同一种表达偏好。

实验中还需要检查Experimental Contamination(实验污染):Source Spillover(来源外溢)、Query Overlap(查询重叠)、Shared Model Update(共享模型更新)、Concurrent Campaign(同期其他活动)、Competitor Change(竞争者变化)、Contamination Path(污染路径)和External Event(外部事件)。例如,公开发布的一篇文章可能同时被处理组和对照组问题检索到;两组同步变化可能来自模型更新,也可能来自干预外溢。对照只提高解释能力,不自动消除污染。

GEO(生成式引擎优化)服务最容易发生的越界,是把“我们做了动作”和“答案随后变化”连成直接因果。事实上,两者之间可能存在模型更新、竞争者行动、时间事件、测量环境变化、会话污染、自然波动和选择性报告。因此,每次Causal Confidence(因果置信度)升级都必须写明理由:对照如何设计,哪些污染路径被识别,重复发生在哪些独立或结构化维度,测量口径是否保持不变,是否存在分析窥视,以及负向、无变化和失败结果是否完整保留。验证性研究在可行时应预先登记主要和次要Query Cluster(查询簇)、Engine(引擎)时间窗口与运行计划、主要和次要指标、包含排除与缺失处理规则、Treatment(处理组)与Control(对照组)及预期方向、停止规则和异常处理。探索性发现可以帮助生成假设,但必须与验证性结果分开报告;先测试大量引擎、查询和指标,再只展示改善最大的一项,会产生Selection Bias(选择偏差)和Multiple Testing Risk(多重检验风险)。

七、组织治理与知识升级资格

如果销售人员可以修改事实审查结论,命题受益方可以删除反向证据,执行人员可以选择最有利的运行结果,再严谨的指标也无法拯救研究。服务体系至少需要区分Entity Reality Steward(实体事实负责人)、Evidence Reviewer(证据审查者)、User Research Coder(用户研究编码者)、AI Behavior Coder(人工智能行为编码者)、Domain Reviewer(领域审查者)、Compliance Reviewer(合规审查者)和Adjudicator(争议裁决者)。小型项目可以由同一人兼任多个角色,但必须记录角色重叠、利益冲突和复核限制。在可行条件下,编码者应不知道Treatment or Control(处理组或对照组)标签、干预前后阶段和预期变化方向;无法Blind(盲法)并不意味着项目必须停止,但结论强度需要相应降低,偏差风险必须披露。任何管理层或商业Override(覆盖)都必须进入Override Log(覆盖日志),记录原结论、覆盖者、理由、补充证据和影响范围。对外报告不得把商业决定伪装成研究裁决。

本书采用以下知识升级路径:

Raw Observation(原始观察)
→ Integrity-checked Record(完整性检查后的记录)
→ Versioned Coding(版本化编码)
→ Operational Hypothesis(操作性假设)
→ Predefined Test(预定义检验)
→ Independent or Structured Repetition(独立或结构化重复)
→ Validated Pattern Candidate(已验证模式候选)
→ 正式准入审查与用户授权
→ Validated Pattern(已验证模式)

这条路径中不存在“看起来很合理,所以直接成为规律”的捷径。数据量大也不能自动跨过观测完整性、编码有效性、独立性、污染和范围限制。当前正式Validated Pattern(已验证模式)为空,这并不表示现有方法没有价值,而是表示体系拒绝把尚未完成验证的经验提前包装成通用规律。

八、三个典型判断练习

情形一:文章被引用,品牌没有出现

可以直接观察文章被显示引用;可以依据编码规则判断其中某个命题是否被答案吸收;不能仅凭引用断言品牌获得有效可见性,也不能断言该来源拥有固定权重。下一步应检查Citation Support Fit(引用支持匹配)、Claim Absorption(命题吸收)和Entity Attribution(实体归属)。

情形二:修改官网后,推荐频率上升

可以描述干预前后在锁定条件下的频率差异。如果没有合格对照、测量不变性、污染检查和重复支持,因果等级仍可能停留在C0(无法判断)或C1(方向信号)。不能直接写成“官网修改使人工智能更信任企业”。

情形三:自动编码与人工编码高度一致

可以报告特定样本和规则下的一致性结果;还需要检查类别分布、错误类型、盲法状态和共同错误。不能把高一致率解释为编码结论真实,更不能据此证明模型内部机制。

这三个例子共同说明:一个结果是否有用,不只取决于数值大小,还取决于它处在何种观测层、使用何种规则、支持哪类命题以及有哪些不能跨越的解释边界。

九、对GEO Service System(GEO服务体系)的要求

认识论不能只存在于白皮书里,它必须进入服务流程和交付对象。

第一,所有关键对象都要带来源、版本、时间、范围和认识状态。一个没有这些字段的“结论”,无法知道它来自原始事实、人工编码、自动判断还是销售表达。

第二,采集层必须保存原始输入、原始输出和失败状态,不能只保存评分与摘要。没有原始记录,就无法重新编码或追查漂移。

第三,诊断必须把Difference(差异)、Gap(缺口)、Root Cause(根本原因)和Intervention(干预)分开。观察到用户重视某变量而答案没有使用,只能先形成差异;是否构成应被修正的缺口,还需要适配、证据、风险和范围判断。

第四,干预必须以Hypothesis(假设)驱动,并预先写明Target Variable(目标变量)、Change Object(改变对象)、Expected Observable(预期可观察结果)、对照、护栏和停止规则。执行完成不是结果发生,结果发生也不是因果成立。

第五,报告必须保留No Change(无变化)、Negative(负向)、Indeterminate(无法判断)、Failure(失败)和No Action(不行动)。如果报告只允许出现“优化成功”,系统就会主动制造选择偏差。

第六,Agent(智能体)可以协助研究和编码,却不能自行把Unknown(未知)改成事实,不能自行授予C4或C5,也不能批准自己的高风险结论。机器验证负责结构和规则,人类复核负责事实、语义、合规和最终责任。

十、本章明确否定的观点

以下观点不得在后续章节或服务材料中恢复:

  • 直接观测天然完整且无误;
  • 显示工具调用就等于知道完整内部检索过程;
  • 编码一致等于编码正确、命题真实或机制成立;
  • 标记“人工已确认”就等于完成独立复核;
  • 同一环境重复次数多就等于独立复现;
  • 超时、拒答、解析失败和截断可以统一编码成“未提及”;
  • 只报告最佳引擎、最佳查询或最佳指标仍代表完整结果;
  • Causal Confidence(因果置信度)可以按运行次数机械升级;
  • 命题受益方可以无记录覆盖不利结论;
  • Truthfulness(真实性)等规范性约束可以包装成人工智能算法偏好;
  • 大规模自动复测天然代表真实用户环境;
  • 单次人工智能输出或人工智能自述可以揭示稳定内部机制。

十一、当前仍然不知道什么

以下问题在当前版本中保持Unknown(未知):

  • C4(跨批复现)与C5(强经验规律)的正式准入标准;
  • 不同任务和风险等级所需的编码一致性标准;
  • Automated Coder(自动编码器)在不同风险等级中的准入范围;
  • 批量接口、研究账户和真实用户环境之间的External Validity(外部有效性);
  • 不可观测个性化上下文对答案的实际影响;
  • Agentic Decision Mediation(智能体式决策中介)的观测与编码方法;
  • Effective Visibility(有效可见性)与受众实际接触、理解、决策和商业结果之间的因果关系;
  • 各引擎真实的检索、重排、上下文选择、实体选择和来源权重机制。

这些未知不是等待文案填补的空白,而是研究边界。把未知明确写出,能够阻止服务过度承诺,也能够形成后续实验真正值得解决的问题。

十二、本章结论

GEO(生成式引擎优化)认识论建立了一条基本纪律:研究可以在黑箱条件下进行,但每项结论都必须知道自己凭什么成立,又在哪里停止。

我们直接观察的是条件化答案行为和可核查记录;我们通过版本化规则进行编码;我们把机制解释保持为假设或未知;我们用对照、重复、污染检查和完整披露提高因果支持;我们把所有结论限制在明确的实体、情境、查询、引擎、时间和测量环境中。

因此,专业GEO与普通“做内容、看排名、报增长”的根本差异,不只是工具更多,而是拥有一套可审查的Knowledge Qualification System(知识资格体系)。它决定哪些材料可以成为数据,哪些判断可以进入诊断,哪些变化可以被称为信号,哪些经验有资格升级,以及哪些话暂时不能说。

第一编至此回答了三个基础问题:为什么常见定义不够,GEO到底是什么,以及我们如何获得关于GEO的可靠知识。下一编将进入具体决策结构:首先界定Decision Situation(决策情境),再逐步建立Decision Variable(决策变量)、User-DVM(用户决策变量地图)、AI-DVM(人工智能决策变量地图)以及二者之间的差异诊断。

本章图表

图3-1|GEO(生成式引擎优化)知识资格五轴模型

重绘说明:中心放置“一个GEO结论”,外围用五个相互独立的轴连接:Epistemic Status(认识状态)、Observability(可观测性)、Claim Mode(命题性质)、Causal Confidence(因果置信度)和Scope(适用范围)。图下注明:“五轴分别标注,不压缩为单一置信总分。”

图3-2|从原始观察到已验证模式的升级路径

重绘说明:采用由左至右的门控流程图,依次为原始观察、完整性检查、版本化编码、操作性假设、预定义检验、独立或结构化重复、已验证模式候选、正式准入审查、已验证模式。每两个节点之间设置Gate(门),在图末使用醒目标注:“当前Validated Pattern(已验证模式)为空。”

表3-1|五轴认识标注卡

建议排版字段:结论编号、原始表述、认识状态、可观测性、命题性质、因果置信度、适用范围、来源记录、限制与禁止推论。该表用于展示如何把一句模糊的“优化有效”拆成可审查结论。