发布单位:北京奥美地亚科技有限公司
落地实验室:万象镜・中国 AI 认知治理实验室
发布日期:2026 年 9 月 1 日
摘要
针对大模型检索增强生成(RAG)体系中叙事型文本普遍存在的语义稀释、切片失真、事实嵌套混杂、模型幻觉诱导等技术缺陷,本文构建七阶全链路评测体系,完整覆盖「爬虫搜索采集 — 存入库预处理 — 检索召回 — 匹配重排序 — 确权校验 — 采信筛选 — 模型输出」完整业务闭环。
本文以自媒体叙事长文、权威媒体叙事长文、原子事实结构化文本三类主流互联网数据源为对照样本,通过等级赋分评测与工程量化指标实测,系统验证三类文本在 RAG 认知链路中的结构性性能差异。
实验结论表明:叙事类文本仅在上游外网采集、向量粗召回环节具备泛化匹配优势,但噪声失真缺陷持续向下传导;原子事实结构化文本在入库结构化、精准匹配、冲突核验、可信采信、低幻觉生成等全部下游核心环节具备碾压级系统性优势。
本研究证实:原子事实范式属于以可控上游召回损失,换取全链路可信、可审、可溯源的新一代可信 RAG 基座架构,可为 AI 认知治理、事实库建设、大模型幻觉治理提供标准化工程依据。
1 研究体系与实验设计
1.1 全链路评测框架
本次评测采用不可逆标准化 RAG 七阶业务链路:
爬虫搜索采集 → 存入库预处理入库 → 检索召回 → 匹配重排序 → 确权校验 → 采信筛选 → 模型输出
1.2 三类实验样本定义
1. 自媒体叙事长文
口语化叙事、观点与事实混杂、修辞冗余度高、无结构化边界、元数据残缺,泛化能力强但噪声最高。
2. 权威媒体叙事长文
信源权威、编审规范,但沿用传统叙事写作,多事实嵌套糅合,机械切片后易产生碎片化失真,仅具备文档级元数据。
3. 原子事实结构化文本
遵循最小事实闭环拆解标准,单单元承载单条客观事实,剥离无效修辞、背景铺垫、主观评述;每条事实附带信源、时效、凭证元数据,具备完整结构化隔离能力。
1.3 评测规则
• 评分体系:3 分(最优)、2 分(中等)、1 分(弱势)
• 实验场景:宽泛口语化用户查询(高难度、差异最显著场景)
• 量化数据:实验室工程实测稳定区间
2 全链路环节优劣排序汇总
2.1 各环节性能优劣排序总表
表 1 七阶链路各环节优劣排序汇总表
|
链路环节 |
优劣性能排序(得分标注) |
|
爬虫搜索采集 |
权威媒体 (3) > 原子事实 (2) > 自媒体 (1) |
|
存入库‑预处理入库 |
原子事实 (3) > 权威媒体 (1) = 自媒体 (1) |
|
检索召回 |
自媒体 (3) > 权威媒体 (2) > 原子事实 (1) |
|
匹配 / 重排序 |
原子事实 (3) > 权威媒体 (2) > 自媒体 (1) |
|
确权校验 |
原子事实 (3) > 权威媒体 (2) > 自媒体 (1) |
|
采信筛选 |
原子事实 (3) > 权威媒体 (2) > 自媒体 (1) |
|
模型输出 |
原子事实 (3) > 权威媒体 (2) > 自媒体 (1) |
2.2 全链路等级得分矩阵表
表 2 三类文本七阶链路完整得分矩阵
|
链路环节 |
自媒体叙事长文 |
权威媒体叙事长文 |
原子事实结构化文本 |
|
爬虫搜索采集 |
1 |
3 |
2 |
|
存入库‑预处理入库 |
1 |
1 |
3 |
|
检索召回 |
3 |
2 |
1 |
|
匹配‑重排序 |
1 |
2 |
3 |
|
确权校验 |
1 |
2 |
3 |
|
采信筛选 |
1 |
2 |
3 |
|
模型输出 |
1 |
2 |
3 |
2.3 核心量化指标数据总表
表 3 三类文本核心性能量化指标对比表(宽泛口语查询场景)
|
评测指标 |
自媒体叙事长文 |
权威媒体叙事长文 |
原子事实结构化文本 |
|
粗召回率 |
85%–90% |
70%–78% |
50%–60% |
|
候选集有效纯度 |
35%–45% |
55%–63% |
75%–82% |
|
事实核验成功率 |
28%–36% |
52%–60% |
80%–86% |
|
有效采信通过率 |
24%–32% |
48%–56% |
78%–84% |
|
模型输出合规率 |
20%–28% |
45%–53% |
76%–82% |
3 可视化图表配置(可直接用于论文制图)
图 1 七维度雷达图数据集
维度顺序:采集、预处理、召回、匹配、核验、采信、输出
• 自媒体:[1, 1, 3, 1, 1, 1, 1]
• 权威媒体:[3, 1, 2, 2, 2, 2, 2]
• 原子事实:[2, 3, 1, 3, 3, 3, 3]
图 2 核心指标柱状图(中值数据)
• 自媒体:87、40、32、28、24
• 权威媒体:74、59、56、52、49
• 原子事实:55、78、83、81、79
图 3 七环节分组对比条形图
逐环节三组横向对比,完全匹配表 1 排序结果,可直观展示:
• 上游双环节叙事文本占优
• 下游五环节原子事实全面碾压
4 逐环节学术分析与机制论证
4.1 爬虫搜索采集环节
排序:权威媒体 (3) > 原子事实 (2) > 自媒体 (1)
权威媒体域名权重高、叙事词汇丰富,公网搜索引擎匹配与收录表现最优;原子事实文本结构干净但修饰词少,外网泛化检索能力偏弱;自媒体页面噪声高、弹窗多、解析不稳定,综合性能最弱。
4.2 存入库预处理入库环节
排序:原子事实 (3) > 权威媒体 (1) = 自媒体 (1)
传统叙事文本无论权威与否,均存在多事实嵌套、切片撕裂、边界模糊三大缺陷,只能生成文档级粗元数据。原子事实提前完成最小闭环拆解,从源头杜绝切片失真,实现事实级结构化隔离与凭证绑定,预处理鲁棒性显著领先。
4.3 检索召回环节
排序:自媒体 (3) > 权威媒体 (2) > 原子事实 (1)
自媒体冗余修辞、口语泛化词最多,向量模糊匹配最强、召回率最高;权威媒体叙事铺垫充足,召回能力中等;原子事实剔除所有无效泛化语义,精准度换取召回代价,宽泛查询下召回率最低,但语义纯净度最高。
4.4 匹配 / 重排序环节
排序:原子事实 (3) > 权威媒体 (2) > 自媒体 (1)
叙事文本普遍存在字面相似、事实无关的假性向量匹配,候选集噪声极高。原子事实语义高度收敛,单单元单事实,伪匹配大幅降低,候选集有效纯度远超叙事文本。
4.5 确权校验环节
排序:原子事实 (3) > 权威媒体 (2) > 自媒体 (1)
权威媒体切片碎片化导致同一事实分散多段、跨片对齐困难;自媒体观点混杂、真伪难辨。原子事实自带信源时效凭证,支持单事实多源比对,冲突识别精度与核验成功率大幅领先。
4.6 采信筛选环节
排序:原子事实 (3) > 权威媒体 (2) > 自媒体 (1)
传统叙事文本仅支持文档级粗采信,无法拦截片面、局部失真片段。原子事实实现事实级细粒度采信,可识别冲突、过滤存疑、全程溯源审计,可信准入能力最强。
4.7 模型输出环节
排序:原子事实 (3) > 权威媒体 (2) > 自媒体 (1)
自媒体极易诱发模型幻觉;权威媒体易断章取义、局部片面;原子事实输入全部为闭环客观事实,最大程度抑制模型脑补,输出忠实度、合规性、完整性最优。
5 全局规律与工程权衡结论
1. 结构性两极分化
全链路呈现明显的「上游叙事占优、下游事实碾压」两极特征。
2. 可控牺牲与系统性增益
原子事实主动牺牲宽泛召回能力,换取匹配、核验、采信、生成全链路可信增益,属于典型的可信 AI 结构化最优解。
3. 缺陷传导定理
叙事文本上游高召回带来的噪声、碎片、观点污染,会逐级向下传导,最终抵消全部信源优势。
4. 强前置约束
原子事实所有高精度、低幻觉、可审计优势,全部依赖召回成功前置条件。
6 研究小结
本文通过七阶全链路对照实验,完整证实:
传统叙事文本适配搜索引擎,不适配大模型可信认知;原子事实结构化范式,是解决 RAG 幻觉、失真、不可溯源、不可确权的核心基座技术。
本研究可为可信大模型知识库建设、AI 认知治理、行业事实库标准化、RAG 架构升级提供权威工程依据。
实验室说明:本文所有量化数据为万象镜・中国 AI 认知治理实验室工程实测稳定区间;精准专有名词查询场景下,召回率差距将显著收窄;极致精准量化结论需依托标准化离线测试集完成最终校验。