第07章|AI-DVM(人工智能决策变量地图):如何观察人工智能答案行为
一、人工智能说了什么,不等于人工智能内部是什么
企业观察生成式人工智能时,最容易做的是提问、截图和计数:品牌有没有出现,排在第几位,答案引用了谁,哪些词出现得最多。进一步的解释往往随之产生:被频繁提及就是“权重高”,列在第一位就是“最推荐”,引用某页面就是“人工智能信任这个来源”,回答自述“依据公开信息”就等于知道了内部检索过程。
这些解释都跨过了可观测边界。
我们能够直接保存的是提示、答案、显示引用、可见工具轨迹、产品条件和时间。我们可以依据规则编码变量出现、立场、篇章功能、实体关联、推荐状态和命题支持,并在明确样本范围内归纳答案行为分布。我们通常不能直接观察完整候选来源集合、后台路由、隐藏上下文、重排、内部权重、训练记忆和完整推理路径。
AI-DVM(Artificial Intelligence Decision Variable Map,人工智能决策变量地图)的任务不是破解模型,而是建立一套可复核的观察体系:在什么条件下,人工智能答案使用了哪些Decision Variable(决策变量),以什么方式使用,与哪些实体和证据发生关系,这些行为是否随探针、表达、上下文、引擎、工具和时间发生变化。
二、AI-DVM(人工智能决策变量地图)的工作定义
AI-DVM(人工智能决策变量地图)是在明确Decision Situation(决策情境)、Query Cluster(查询簇)、Functional Probe(功能性探针)、表达、上下文、Engine(引擎)、产品模式、运行和时间条件下,由一组可追溯Answer Observation(答案观察)经过受控编码形成的条件化答案行为分布。它描述答案中哪些Decision Variable(决策变量)以何种出现、显著性、作用、方向、条件、实体关联、证据支持和推荐状态被使用,不声明模型内部如何检索、推理、加权或生成。
这一定义有四个关键词:
- Observed(被观察):来自实际答案记录,不来自人工智能自述或研究者想象;
- Conditional(条件化):结论绑定查询、探针、上下文、产品、运行和时间;
- Behavioral(行为性):描述答案表现,不声明内部心理和机制;
- Temporal(时间性):地图具有时间窗口,可能漂移、过期或被替代。
AI-DVM(人工智能决策变量地图)是Sample-bound Distribution(样本约束分布),不是某个模型的永久属性,也不是“全网人工智能共同认知”。
三、四层认识边界
| 层级 | 对象 | 可以做什么 | 不能越界成什么 |
|---|---|---|---|
| Raw Observation(原始观察) | 完整提示、回答、显示引用、时间与产品条件 | 保存、复核、重新编码 | 完整内部生成过程 |
| Coded Observation(编码观测) | 变量、立场、作用、实体关联、证据支持等 | 按编码手册形成结构数据 | 天然真实或无偏判断 |
| Behavioral Inference(行为推断) | 限定样本中的答案行为分布 | 比较条件、提出假设 | 模型永久偏好或普遍规律 |
| Latent Mechanism(潜在机制) | 检索、重排、注意、记忆、权重和推理链 | 原则上标记Unknown(未知) | 由答案表面直接推断 |
人工智能回答“我之所以推荐甲,是因为它更专业”,仍然是一段新的生成结果。它可以作为答案文本被分析,却不是对内部机制的直接观察。
四、最小Observation Unit(观察单元)
每项观察至少绑定:
Project / Entity(项目或实体)
× Decision Situation(决策情境)
× Query Cluster(查询簇)
× Functional Probe(功能性探针)
× Prompt / Paraphrase(提示或同义改写)
× Conversation State(对话状态)
× Engine / Model Label(引擎或模型标签)
× Product / Tool Configuration(产品或工具配置)
× Locale / Language(地区或语言)
× Account / Personalization State(账户或个性化状态)
× Run / Dependency Cluster(运行或依赖簇)
× Batch / Time(批次或时间)
× Experiment Phase(实验阶段)
无法获得的条件标记Not Observable(不可观测)或Unknown(未知),不得默认恒定。同一个产品名称和模型标签,也不能证明后台路由和版本始终相同。
五、正确测量顺序
Decision Situation(决策情境)
→ User-DVM(用户决策变量地图)与未知项
→ AI-addressable Information Task(人工智能可介入的信息任务)
→ Query Cluster(查询簇)
→ Functional Probe(功能性探针)
→ Paraphrase / Scenario Manipulation(同义改写或情境操纵)
→ Controlled Observation(受控观察)
→ Raw Capture(原始保存)
→ Coding and Review(编码与复核)
→ Conditional AI-DVM(条件化人工智能决策变量地图)
Query(查询)是测量表达,不是研究起点。大量随机问题无法补偿Decision Situation(决策情境)不清,也不能自动形成真实用户地图。
User-DVM(用户决策变量地图)为探针设计提供用户侧参照,却不能规定人工智能必须使用哪些变量。AI-DVM(人工智能决策变量地图)必须来自实际答案观察,而不是把用户变量预填进人工智能地图。
六、Functional Probe(功能性探针)不是同一种问题
| 探针 | 主要观察对象 | 不能单独支持的结论 |
|---|---|---|
| Criteria Probe(标准探针) | 答案能表达哪些判断标准 | 推荐时实际使用了全部标准 |
| Recommendation Probe(推荐探针) | 候选、推荐、条件和排除 | 被推荐实体真实具备资格 |
| Comparison Probe(比较探针) | 比较维度、差异与权衡 | 用户真实按相同维度比较 |
| Risk Probe(风险探针) | 风险、边界、否决和不适配 | 正常推荐任务中同等显著 |
| Scenario Probe(情境探针) | 条件变化后的答案结构 | 某个单一变量导致变化 |
| Counterfactual Probe(反事实探针) | 有限条件改变后的行为差异 | 模型内部机制或现实因果 |
每个探针必须附带Probe-to-Claim Contract(探针—结论契约),明确Intended Claim(预期支持结论)与Prohibited Inference(禁止推断)。
人工智能可能在标准探针中列出十项标准,却在推荐探针中只依赖地域和知名度。Criteria Availability(标准可表达性)不等于Recommendation Use(推荐使用)。跨探针聚合时必须保留探针层分布。
七、探针构造与提示来源
探针要检查决策对象、主体、约束、信息功能、预期答案类型、目标变量植入、目标企业暗示、不实前提和资格假定。
Neutral Probe(中性探针)、Leading Probe(诱导性探针)和Branded Probe(品牌植入探针)属于不同测量条件。诱导性问题可以用于敏感性实验,却不能冒充自然答案基线。
变量首次进入对话的来源需要标记:
- User-seeded(用户植入);
- Researcher-seeded(研究者植入);
- Document-provided(文件提供);
- Prior Assistant Turn(此前人工智能轮次引入);
- Tool-result Introduced(工具结果引入);
- Unprompted in Current Answer(当前回答非提示出现);
- Unknown Origin(来源未知)。
变量出现还应区分Prompt-seeded Presence(提示植入出现)、Echoed Presence(复述出现)、Transformed Use(转换后使用)和Unprompted Presence(非提示主动出现)。
提示中写入“价格最重要吗”,回答大量讨论价格,首先证明系统回应了提示。即使回答否定“只看低价”,关键词计数也会显示价格高频,因此变量出现、立场与作用必须分离。
八、同义改写必须经过等价门槛
Paraphrase(同义改写)应保持情境、对象、信息需求、约束、功能和预期答案类型。如果一个问题写“预算有限”,另一个写“重视长期价值”,它们已经改变了决策条件,属于Scenario Variant(情境变体),不能用来测量纯措辞波动。
每组表达执行Manipulation Check(操纵检查):
- Intended Constant(预期保持项);
- Intended Change(预期改变项);
- Unintended Change(非预期改变项);
- Functional Equivalence(功能等价);
- Adjudication Result(裁决结果)。
大量近似模板不会自动增加独立样本量。形式变化如果共享同一种结构偏好,可能只是重复测量同一狭窄表达空间。
九、Counterfactual Design(反事实设计)要隔离操纵
反事实探针优先采用One-factor-at-a-time(单因素变化),或使用明确的多因素设计。每次记录Baseline(基线)、Manipulated Factor(操纵因素)、Held-constant Conditions(保持条件)和Manipulation Fidelity(操纵保真度)。
从“小企业、低预算、非紧急”同时改成“大企业、高预算、紧急”,答案变量发生变化,只能说明Joint-condition Difference(联合条件差异)。它不能识别规模、预算还是紧急度造成变化,更不能揭示内部机制。
十、上下文、个性化和工具必须分层
分离Fresh Context(空白上下文)、Multi-turn Context(多轮上下文)、Provided-document Context(文件上下文)和Follow-up(追问)。多轮对话中,前一轮由人工智能提出的变量可能在后续形成Self-conditioning(自我条件化)和Anchor Carryover(锚定延续),不能被当成独立主动出现。
观察环境至少分为:
- Clean-room Run(洁净环境运行):尽可能控制账户、记忆、上下文、工具与地区,用于提高可比性;
- Naturalistic Run(自然使用环境运行):保留真实账户、历史与个性化,用于理解实际使用;
- Unknown-state Run(状态未知运行):关键条件无法确认。
洁净环境提高可比性,不等于真实用户环境;自然环境提高生态真实性,却混入更多个体条件。
Search-on(开启搜索)、Search-off(关闭搜索)和Tool-mediated Observation(工具介导观察)也必须分开。若可见,应保存Search Result Snapshot(搜索结果快照)或工具输出。已观察产品配置与Inferred Backend Change(推断后台变化)不能混同。
十一、Run(运行)不等于独立样本
同一会话连续点击重新生成十次,这十个输出共享上下文、账户、时间、产品路由和可能的缓存。它们是十次名义运行,不是十个已证明独立样本。
应按共享会话、账户、上下文、时间、缓存、搜索结果、产品路由和上游工具结果建立Dependency Cluster(依赖簇),并分别报告:
- Nominal Run Count(名义运行数);
- Valid Answer Count(有效回答数);
- Dependency Cluster Count(依赖簇数量);
- Time Batch Count(时间批次数);
- Independence Status(独立性状态);
- Effective Sample Size(有效样本量):只有存在适当估计方法时才报告,否则为Unknown(未知)。
短期大量运行也不能替代跨时间覆盖。如果一天运行一百次、下个月只运行一次,总体分布几乎完全由某一天的产品状态决定。优先采用Balanced Panel(平衡面板);不平衡时同时提供按运行和按批次结果,并说明Batch Weighting(批次权重)。
十二、Raw Record, Denominator and Coding(原始记录、分母与编码)
每次观察至少保存Exact Prompt(完整提示)、Full Answer(完整回答)、显示引用、链接来源、实体提及、时间戳、产品条件、错误或截断、保存方式、记录完整性和Observation ID(观察编号)。
只保存摘要、局部截图或最终评分,无法支持复核和重新编码。原始答案、自动编码、人工编码和最终裁决必须分别保存。
这条规则也保护项目免受分类表变化影响:当变量定义被拆分、合并或修订时,团队仍可以回到原始输出重新编码,而不是把旧评分当作不可逆事实。
Denominator Ledger(分母台账)记录每个测量单元的完整进入与排除过程:
- Requested Runs(请求运行数);
- Completed Outputs(完成输出数);
- Valid Answers(有效回答数);
- Refusals(拒答);
- Safety Blocks(安全拦截);
- Tool or Network Failures(工具或网络失败);
- Truncations(截断);
- Off-topic Outputs(偏题输出);
- Language Mismatches(语言不匹配);
- Exclusions and Reasons(排除及原因)。
拒答、失败、截断和安全拦截不是普通“变量未出现”。删除它们会形成Complete-case Bias(完整案例偏差)。高风险问题经常被拒答时,只分析剩余低风险答案,可能让风险变量分布看起来异常稳定。
回答完整性标记Complete(完整)、Possibly Truncated(可能截断)、Confirmed Truncated(确认截断)、Partial Tool Result(部分工具结果)或Indeterminate(无法判断)。截断答案不能与完整答案等价编码为Not Mentioned(未提及)。
Closed Coding(封闭编码)与Open Coding(开放编码)承担不同发现任务。
Closed Coding(封闭编码)依据现有变量分类表识别已知变量;Open Coding(开放编码)用于发现Candidate DV(候选决策变量)。
开放编码提出的新变量必须给出操作定义、文本锚点、反例、与已有变量的区分、重复观察和复核。封闭编码不能压制新变量,开放编码也不能因为一次新词出现就无限扩张分类表。
人工智能使用User-DVM(用户决策变量地图)中没有的“数据迁移成本”,可能是有价值的候选发现,也可能来自探针诱导、范围差异或用户研究缺失。在第八章比较前,它不是自动错误。
十三、Presence, Stance and Discourse Function(出现、立场与篇章功能)
Variable Presence(变量出现)至少区分Explicit(明确)、Semantic(语义)、Conditional(条件性)、Negated(否定性)、Example-only(仅示例)、Prompt Echo(提示复述)、Not Present(未出现)和Indeterminate(无法判断)。
另行编码:
- Stance(立场):Supportive(支持)、Cautionary(警示)、Rejecting(否定)、Neutral(中性)、Mixed(混合)或Unknown(未知);
- Scope of Negation(否定范围):变量整体、特定取值、特定实体、特定情境或无法判断;
- Assertion Mode(断言方式):Asserted(断言)、Hedged(保留)、Conditional(条件性)、Quoted(转述)或Hypothetical(假设)。
关键词命中不能替代语义、立场和范围编码。回答说“低价不应是主要标准”,不是把价格作为正向偏好。
长答案比短答案更容易出现更多变量。深度模式生成两千字、快速模式生成两百字,变量数量不能直接比较,因为Answer Opportunity(答案表达机会)不同。
记录答案长度、结构、是否要求详述、列表限制和响应模式。变量位置标记Main Reasoning(主要论述)、Decision Rule(决策规则)、Caveat(保留意见)、Disclaimer(免责声明)、Example(示例)、Boilerplate(模板文本)或Summary(总结)。
可以同时提供Raw View(原始视图)和Length-normalized View(长度校正视图),但校正值仍然是观察性指标,不是内部权重。模板免责声明中出现“合规”和“安全”,不能自动编码为实际推荐作用。
十四、Variable Salience(变量显著性)不是内部权重
显著性可以由位置、重复、展开程度、标题或总结、推荐依赖、淘汰依赖、跨表达和跨运行重复等可观察指标描述。
这些指标分别报告。当前不合成为统一Salience Score(显著性评分),更不能把答案层显著性解释为模型内部注意权重、信任程度或永久优先级。
同一个变量在标准探针中展开较多、在推荐探针中没有进入理由链,应分别记录,而不是用平均显著性掩盖功能差异。
十五、答案赋予的Decision Role(决策作用)
沿用Trigger(触发)、Qualification(资格)、Preference(偏好)、Elimination(淘汰)、Trust(信任)和Conversion(转化)。在AI-DVM(人工智能决策变量地图)中,这些标签只表示答案文本赋予变量的作用,不证明现实用户真的如此决策。
方向允许Positive(正向)、Negative(负向)、Threshold(阈值)、Non-monotonic(非单调)、Conditional(条件化)、Trade-off(权衡)和Unknown(未知)。
答案明确陈述的关系与研究者编码的关系需要分开。每条Edge(关系边)保存文本锚点、条件、范围、替代解释和反向陈述。答案关系不等于现实因果,更不等于模型内部机制。
十六、Entity Resolution(实体消歧)
实体识别不能只做名称字符串匹配。同名企业、品牌与法律主体差异、地域分支和错误链接都可能制造虚假提及。
至少核验Legal or Brand Name(法律主体或品牌名称)、Website or Domain(网站或域名)、Region(地域)、Service Scope(服务范围)、Linked Source(链接来源)和Distinguishing Attribute(区分属性)。
结果标记Confirmed Identity(确认身份)、Probable Identity(可能身份)、Ambiguous Mention(歧义提及)、Wrong Entity(错误实体)或Hallucinated Entity(虚构实体)。只有达到预设身份资格的提及才能进入目标实体呈现分母。
十七、实体出现不等于属性归属
分离Generic Variable(通用变量)、Category Association(类别关联)、Entity Association(实体关联)、Competitor Association(竞品关联)、Misattribution(错误归属)和No Established Association(未建立关联)。
回答先说“行业经验很重要”,随后列出甲公司名称,并不表示答案认为甲公司拥有行业经验。必须存在Entity-Variable Link Anchor(实体—变量连接锚点),例如明确语言、表格结构、语法关系或命题级证据连接。
Knowledge Presence(知识出现)、Entity Presence(实体出现)和Correct Attribution(正确归属)是三个不同对象。高提及率不能掩盖属性来自竞品或错误实体。
十八、Recommendation Status(推荐状态)与列表顺序
推荐状态区分:
- Included in Candidate Set(进入候选集合);
- Explicitly Recommended(明确推荐);
- Conditionally Recommended(条件性推荐);
- Compared not Recommended(比较但未推荐);
- Excluded or Warned Against(排除或警告);
- Not Mentioned(未提及);
- Hallucinated(虚构)。
列表还要标记Ordered List(有序列表)、Unordered List(无序列表)或Ambiguous Order(顺序不明)。答案声明“不分先后”时,第一位不能被编码为最强推荐。
AI-assigned Eligibility(人工智能赋予的资格)与Evidence-backed Entity Eligibility(证据支持的实体资格)必须分离。人工智能推荐并不能证明企业真实适配。
十九、引用审查必须下沉到原子命题
复合句“甲公司持证、零差错、响应快”可能只引用一个证明许可证的页面。页面主题相关不等于支持整句话。
每条Atomic Answer Claim(原子答案命题)记录:
- Claim Text(命题文本)与Claim Type(命题类型);
- Entity and Variable Link(实体与变量连接);
- Displayed Citation(显示引用);
- Citation Supports Claim(引用支持命题);
- Partial Support(部分支持)与Citation Conflict(引用冲突);
- Source Identity(来源身份);
- Accuracy Status(准确性状态);
- Assessability(可评估性)。
必须保持以下不等式:
Displayed Citation(显示引用)
≠ Claim-level Citation Support(命题级引用支持)
≠ Citation Absorption(引用吸收)
≠ Retrieval(检索)
≠ Internal Evidence Use(内部证据使用)
没有显示引用,只能说明界面没有显示引用,不能证明没有检索、没有依据或完全来自模型记忆。出现引用也不能暴露完整候选来源集、重排和内部唯一来源。
二十、编码者和自动评判器也需要治理
编码流程包括编码表设计、试编码、训练、Blind Double Coding(盲法双重编码)、一致性与争议复核、裁决、版本化和漂移监测。
记录编码者是否对目标企业、实验阶段、预期变量和干预方向盲化。Inter-coder Agreement(编码者一致性)不等于编码有效性或命题真实性。
Automated Judge(自动评判器)需要记录模型、版本、提示、编码表、输入范围、人工参照样本、错误模式、校准、覆盖日志和漂移。同一模型生成并评判可能产生Shared-model Bias(同模型偏差),需要Cross-model Calibration(跨模型校准)和按答案来源引擎分层的错误分析。
分类表拆分、合并或改名可能制造虚假趋势。跨版本比较需要Back-coding(历史回编码)或Bridge Coding(桥接编码);无法桥接时标记Non-comparable Across Taxonomy Versions(分类版本间不可比)。
二十一、最低编码字段不合成为总分
最低字段包括Variable Presence(变量出现)、Prompt Provenance(提示来源)、Stance(立场)、Variable Salience(变量显著性)、Discourse Function(篇章功能)、Decision Role(决策作用)、方向或阈值、Entity Identity(实体身份)、Entity Association(实体关联)、Evidence Support(证据支持)、Recommendation Status(推荐状态)、Claim Accuracy(命题准确性)、资格或风险边界、文本锚点、编码表版本、编码者、盲化、编码置信、争议与裁决。
这些字段分别回答不同问题,不合成为统一AI-DVM Score(人工智能决策变量地图评分)。总分会掩盖“提及增加但错误归属上升”“推荐增多但证据支持下降”这类关键冲突。
二十二、Conditional Aggregation(条件化聚合)
Answer Observation(答案观察)
→ Dependency-cluster Pattern(依赖簇模式)
→ Paraphrase-level Pattern(表达层模式)
→ Probe-level Pattern(探针层模式)
→ Cluster-level Pattern(查询簇层模式)
→ Engine-time-specific Map(特定引擎与时间地图)
→ Conditional Cross-engine Comparison(条件化跨引擎比较)
可以报告变量出现、作用、实体关联、推荐和证据支持的条件化分布,但必须同时提供请求分母、有效回答、失败、依赖簇、批次、条件范围和不确定性。
按运行聚合与按批次聚合要同时检查。平均值不能掩盖探针差异、安全策略、拒答、方向反转和某个时间点对总体的支配。
二十三、稳定性、敏感性和变化检测
分离同提示变异、表达敏感性、探针敏感性、上下文敏感性、工具敏感性、产品模式敏感性、个性化敏感性、引擎敏感性和时间漂移。
稳定性必须说明对象、条件、重复单位与时间范围。当前没有统一Stability Score(稳定性评分)或正式准入阈值。
Change Detection(变化检测)只描述条件化分布发生变化。模型更新、搜索结果、政策新闻、竞争内容、产品路由和项目干预都可能解释差异。因果归因需要外部环境记录、对照、重复和Causal Confidence(因果置信度),不能由前后变化直接得出。
二十四、跨条件比较先检查Measurement Invariance(测量不变性)
跨时间、引擎、语言、产品模式或安全状态比较前,需要检查:
- Decision Situation Equivalence(决策情境等价);
- Probe Function Equivalence(探针功能等价);
- Prompt Meaning Equivalence(提示含义等价);
- Context and Tool Equivalence(上下文与工具等价);
- Answer Opportunity Comparability(表达机会可比);
- Coding and Taxonomy Equivalence(编码与分类等价);
- Time-window Overlap(时间窗口重叠)。
结论只能是Comparable(可比)、Partially Comparable(部分可比)、Not Comparable(不可比)或Indeterminate(无法判断)。不满足时只能并列描述,不能排名或归因。
不同引擎原则上分别建图并分别提供分母。跨引擎重复只能称为Conditional Cross-engine Recurrence(条件化跨引擎重复),不证明共享算法、来源和内部权重。一个引擎运行一百次、另一个运行五次时,不能按原始运行数合成“总体人工智能认知”。
二十五、与User-DVM(用户决策变量地图)的边界
User-DVM(用户决策变量地图)表达用户侧决策证据所支持的结构;AI-DVM(人工智能决策变量地图)表达条件化答案行为分布。二者可以通过共同字段比较,却不能相互替代。
人工智能使用用户地图未出现的变量,可能是候选发现、探针诱导、范围差异或用户研究缺失,不自动判为错误。人工智能没有提及用户重视的价格,也可能因为当前是Risk Probe(风险探针),没有提供合理表达机会。
第八章比较前必须通过Opportunity-to-Express Gate(表达机会门槛):该探针、答案类型、长度和上下文是否为目标变量提供了合理出现机会。
二十六、AI-DVM Card(人工智能决策变量地图卡)
最低记录必须覆盖目的与范围、表达与上下文、产品条件、运行结构、原始记录、分母、变量编码、实体与推荐、命题与证据、编码治理、比较资格和双地图接口十二组信息。完整填写结构集中在附录C|Method Templates(方法模板),认识状态与禁止越级措辞见附录D|Epistemic Status(认识状态)与因果措辞。
二十七、对GEO Service System(GEO服务体系)的要求
第一,系统必须保存原始提示、完整回答、产品条件、工具状态、运行结构和分母台账,不能只保存评分或摘要。
第二,探针必须携带Probe-to-Claim Contract(探针—结论契约)。标准、推荐、比较、风险、情境和反事实探针不得互相替代结论资格。
第三,提示植入、复述、前序轮次、文件或工具引入与非提示主动出现必须分别编码;同义改写和反事实必须经过等价与操纵检查。
第四,运行必须按Dependency Cluster(依赖簇)治理,拒答、失败、截断和安全状态保留在分母中。名义次数不能冒充有效样本量。
第五,变量出现、立场、篇章功能、显著性、作用、实体关联、证据支持和推荐状态必须分开。任何统一总分都不得替代这些字段。
第六,实体身份、属性归属、推荐和命题级证据需要独立核验。显示引用不得扩展为内部检索或权重声明。
第七,跨引擎、时间、语言和产品模式比较必须先通过Measurement Invariance(测量不变性)。无法比较时,系统应明确拒绝排名。
第八,AI-DVM(人工智能决策变量地图)的变化只进入变化检测;归因必须交给后续实验和测量体系。
二十八、本章明确否定的观点
- 询问人工智能自述即可获得AI-DVM(人工智能决策变量地图);
- 单次回答代表稳定人工智能认知;
- 提示植入或复述变量等于人工智能主动使用;
- 变量出现或显著性等于内部权重、信任或推荐;
- 标准探针中的变量等于推荐探针实际使用;
- 改变情境条件的问法仍是纯同义改写;
- 多因素反事实差异可归因于单一因素;
- 同一会话重新生成等于独立样本;
- 名义运行数等于有效样本量;
- 短期大量运行等于长期稳定;
- 长答案变量更多证明模型更重视这些变量;
- 模板免责声明等于决策作用;
- 名称字符串匹配等于实体确认;
- 文本邻近等于实体属性关联;
- 列表第一位自动等于最强推荐;
- 显示引用等于命题支持、引用吸收、检索或内部证据使用;
- 页面相关可以支持全部复合命题;
- 自动评判器天然客观;
- 分类表变化制造的趋势可以当作答案行为趋势;
- 删除拒答、失败和截断不会改变分布;
- 不同语言、搜索模式和时间可以无条件排名引擎;
- 跨引擎平均代表“总体人工智能认知”;
- AI-DVM(人工智能决策变量地图)可以替代User-DVM(用户决策变量地图);
- 答案行为前后变化直接证明GEO(生成式引擎优化)干预有效。
二十九、当前仍然不知道什么
以下问题保持Unknown(未知):
- 各产品真实的检索、重排、上下文选择和生成机制;
- 隐藏版本、路由、缓存、实验分流和个性化影响;
- 各查询簇合理的探针、表达、依赖簇、批次和时间数量;
- 不同运行条件下有效样本量的估计方法;
- 答案长度校正和显著性指标的任务级有效性;
- 实体身份置信状态的任务级准入标准;
- 自动评判器跨模型、语言和文体的有效性;
- 分类表桥接达到可比的准入标准;
- 测量不变性和跨引擎可比性的经验门槛;
- 稳定性、漂移与地图过期的准入标准;
- 显示引用、命题支持、引用吸收与内部证据使用之间的真实关系;
- AI-DVM(人工智能决策变量地图)变化与干预、用户行为及业务结果的因果关系;
- 可升级为Validated Pattern(已验证模式)的准入标准。
当前Validated Pattern(已验证模式)为空。
三十、本章结论
AI-DVM(人工智能决策变量地图)是一张条件化答案行为地图。它不通过人工智能自述猜测内部算法,而是从受控探针、完整原始记录、分母台账和版本化编码出发,描述变量如何出现、以何种立场和篇章功能被使用、与哪些实体和证据发生连接、形成何种推荐状态。
专业观察的关键,不是简单增加提问次数,而是保证探针与结论匹配,提示来源可追踪,表达和操纵可审查,上下文与产品条件可区分,运行依赖与失败进入分母,实体与命题逐层核验,跨条件比较具有可比性。
User-DVM(用户决策变量地图)和AI-DVM(人工智能决策变量地图)现在分别建立完成。下一章将把两张地图与Entity Reality(实体真实状态)及Claim-Evidence Status(命题—证据状态)放在同一比较框架中,研究它们之间的Difference(差异)。但差异不自动等于Gap(缺口),更不自动等于Intervention Priority(干预优先级)。
本章图表
图7-1|AI-DVM(人工智能决策变量地图)四层认识边界
重绘说明:纵向展示Raw Observation(原始观察)、Coded Observation(编码观测)、Behavioral Inference(行为推断)和Latent Mechanism(潜在机制)。前三层使用实线连接,潜在机制使用虚线与Unknown(未知)标识。
图7-2|探针—结论契约矩阵
重绘说明:以六类Functional Probe(功能性探针)为行,以标准可表达性、推荐使用、比较结构、风险边界、条件变化和反事实差异为列,标记每类探针主要支持、有限支持和禁止推断的结论。
图7-3|运行、依赖簇与时间批次
重绘说明:展示多个Run(运行)如何因共享会话、账户、搜索结果和时间被归入Dependency Cluster(依赖簇),多个依赖簇再归入Time Batch(时间批次)。图下注明:“名义运行数不等于有效样本量。”
图7-4|AI-DVM(人工智能决策变量地图)最低编码层
重绘说明:围绕一条原始答案,分别拉出变量出现、提示来源、立场、篇章功能、显著性、决策作用、实体身份、实体关联、推荐状态、原子命题、引用支持和准确性,避免合成单一评分。
图7-5|引用可观测边界
重绘说明:用不等式链展示显示引用、命题级引用支持、引用吸收、检索和内部证据使用。前两项标为可直接或经审查观察,后两项标为通常不可观测,引用吸收标为受控行为编码。
表7-1|AI-DVM Card(人工智能决策变量地图卡)
采用本章第二十六节的十二组记录面与附录C的完整模板,重点突出原始记录、分母、变量编码、实体推荐、原子命题与比较资格。