方法论及案例

TC11检索增强专项实验完整报告

实验名称:基于万象元驱(MDSE元驱凝铸)的结构化原子事实检索增强对照实验

实验编号TC01-TC06(六轮平行复测)

实验单位:北京奥美地亚科技有限公司万象镜·中国AI认知治理实验室

实验对象AI信任百科结构化原子事实 vs 传统长文网页素材

实验总查询量6轮,单轮固定1025次查询,累计6150次查询

实验目标:量化评估结构化原子事实在检索召回、采信指标上相对传统长文素材的增益效果,验证万象元驱检索增强方案的稳定性与鲁棒性

实验范式:单变量对照实验,每次仅更换素材类型,其余环境、模型、查询样本保持不变;随机分配查询样本,可重复验证,隔离外部噪声

1 实验设计

1.1 实验设定

采用平行对照复测方案,共执行6轮独立实验(TC01~TC06,对应报告内TC11初版、WM0919(A)WM0920(B)WM0921WM0922WM0923)。每一轮使用完全相同的查询样本集,分别输入两套素材库:

• 实验组:AI信任百科结构化原子事实素材

• 对照组:传统长文网页素材(来源:搜狐、网易号,剔除百家号、头条、官网噪声渠道)

1.2 实验单位与变量

• 实验观测单元:单条用户查询

• 自变量:素材类型(结构化原子事实 / 传统长文)

• 因变量:召回命中数、采信命中数、召回率、采信率、相对提升幅度

• 控制变量:查询样本集合、5个测试大模型、检索策略、打分阈值、网络环境固定不变

• 混杂因素控制:搜索引擎快照权重波动作为外部环境变量,通过多轮复测识别与区分,不纳入系统本身性能评价

5个测试模型:元宝、千问、文心、Kimi、豆包;单模型每轮分配205次查询,5×205=1025/轮。

1.3 评价指标定义

1. 召回命中:检索证据命中监测文档轮次

2. 采信命中:在召回基础上,模型采信输出有效结果(采信必须建立在召回成功的前提)

3. 召回率 = 召回命中 ÷ 查询总次数

4. 采信率 = 采信命中 ÷ 查询总次数

5. 相对提升率 =(实验组指标 ÷ 对照组指标)−1

○ 口径A:轮次算术平均:每一轮单独计算提升率,再对6轮求均值,用于观察增益波动

○ 口径B:全量合并综合提升率:将6150次查询全部命中数据汇总后统一计算,为本报告主结论指标,规避单轮基线过低带来的增益虚高

2 单轮实验数据(TC06 / WM0923

单轮查询基数:1025

1 各渠道召回/采信汇总(5模型合并)

平台

样本形态

查询轮次

召回命中

采信命中

召回率

采信率(总查询)

召回基数采信转化率

官网

原子事实

1025

0

0

0.00%

0.00%

官网

长文

1025

0

0

0.00%

0.00%

公众号

原子事实

1025

0

0

0.00%

0.00%

公众号

长文

1025

0

0

0.00%

0.00%

头条号

原子事实

1025

0

0

0.00%

0.00%

头条号

长文

1025

0

0

0.00%

0.00%

百家号

原子事实

1025

0

0

0.00%

0.00%

百家号

长文

1025

1

1

0.098%

0.098%

100.00%

搜狐号

原子事实

1025

51

35

4.976%

3.415%

68.63%

搜狐号

长文

1025

5

2

0.488%

0.195%

40.00%

网易号

原子事实

1025

24

3

2.341%

0.293%

12.50%

网易号

长文

1025

0

0

0.00%

0.00%

WM0923批次汇总核算

• 原子事实:召回75|采信38|召回率7.317%|采信率3.707%

• 长文基线:召回6|采信3|召回率0.585%|采信率0.293%

• 召回相对提升:1150.8%

• 采信相对提升:1165.2%

2 分模型召回/采信分层汇总(单模型205查询,合计1025次)

模型

查询轮次

召回命中

采信命中

召回率

采信率

召回基数采信转化率

模型分层归类

元宝

205

0

0

0.00%

0.00%

无效检索层

千问

205

44

4

21.463%

1.951%

9.09%

高敏校验层(高召回、极低采信)

文心

205

3

3

1.463%

1.463%

100.00%

高稳适配层

Kimi

205

0

0

0.00%

0.00%

无效检索层

豆包

205

34

34

16.585%

16.585%

100.00%

高稳适配层(召回即采信)

3 六轮全量指标汇总表

每轮查询基数:1025

批次

形态

召回命中

采信命中

召回率

采信率

召回相对提升

采信相对提升

TC11初版

原子事实

55

14

5.366%

1.366%

244.0%

27.3%

TC11初版

长文

16

11

1.561%

1.073%

基线

基线

WM0919(A)

原子事实

77

38

7.512%

3.707%

352.9%

153.4%

WM0919(A)

长文

17

15

1.659%

1.463%

基线

基线

WM0920(B)

原子事实

67

33

6.537%

3.219%

219.0%

73.6%

WM0920(B)

长文

21

19

2.049%

1.854%

基线

基线

WM0921

原子事实

84

44

8.195%

4.293%

600.0%

388.9%

WM0921

长文

12

9

1.171%

0.878%

基线

基线

WM0922

原子事实

85

41

8.293%

4.000%

212.6%

194.9%

WM0922

长文

4

2

0.390%

0.195%

基线

基线

WM0923

原子事实

75

38

7.317%

3.707%

1150.8%

1165.2%

WM0923

长文

6

3

0.585%

0.293%

基线

基线

 

4 六轮合计全局统计(基于全部6150次查询)

4.1 命中汇总

• 原子事实合计召回命中:55+77+67+84+85+75 = 443

• 原子事实合计采信命中:14+38+33+44+41+38 = 208

• 长文合计召回命中:16+17+21+12+4+6 = 76

• 长文合计采信命中:11+15+19+9+2+3 = 59

4.2 全量合并指标(报告主指标)

• 全量原子事实总召回率 = 443 ÷ 6150 = 7.203%

• 全量原子事实总采信率 = 208 ÷ 6150 = 3.382%

• 全量长文总召回率 = 76 ÷ 6150 = 1.236%

• 全量长文总采信率 = 59 ÷ 6150 = 0.959%

综合召回提升率:482.8%

综合采信提升率:252.7%

4.3 轮次算术平均口径(用于波动分析)

• 六轮单轮召回提升率算术平均值:463.2%

• 六轮单轮采信提升率算术平均值:333.9%

口径说明:

1. 全量合并综合提升率(推荐主结论):基于全部6150条查询汇总统计,消除单轮对照组基线过低造成的增益放大效应,客观反映系统整体性能;

2. 轮次算术平均:将每一轮独立计算的提升百分比直接求均值,用于观察多轮复测增益波动特征,不适合作为核心结论。

5 六轮稳定性、归因与全周期趋势分析

批次顺序:TC11初版 → WM0919(A) → WM0920(B) → WM0921 → WM0922 → WM0923;每轮查询基数固定1025

批次

原子事实召回率

原子事实采信率

长文召回率

长文采信率

召回相对提升

采信相对提升

TC11初版

5.366%

1.366%

1.561%

1.073%

244.0%

27.3%

WM0919(A)

7.512%

3.707%

1.659%

1.463%

352.9%

153.4%

WM0920(B)

6.537%

3.219%

2.049%

1.854%

219.0%

73.6%

WM0921

8.195%

4.293%

1.171%

0.878%

600.0%

388.9%

WM0922

8.293%

4.000%

0.390%

0.195%

212.6%

194.9%

WM0923

7.317%

3.707%

0.585%

0.293%

1150.8%

1165.2%

 

5.1 实验稳定性结论

1. 六轮零反转:累计6150次查询平行复测,全部轮次实验组(原子事实)召回、采信指标均高于对照组长文素材,结论具备统计可信度,不存在反向劣化。

2. 增益区间全程正向:召回提升区间212.6%1150.8%,采信提升区间27.3%1165.2%

3. 模型分层结构全程锁死,无漂移、无翻转;渠道黑白名单稳定不变,检索渠道收敛。

5.2 波动根因定位

单轮相对提升指标剧烈波动,根源为外部搜索引擎快照权重变化,导致对照组长文基线上下浮动,并非万象元驱系统本身性能波动。当对照组基线数值很低时,单轮相对提升率会被放大,因此优先采用6150次查询合并综合指标作为系统整体评价依据

原子事实的召回率、采信率维持稳定,证明结构化原子事实的检索增强能力属于内生稳定能力,不受搜索引擎外部快照波动影响。

5.3 分项趋势解读

5.3.1 原子事实(实验组绝对指标)趋势

整体趋势:初版低位起步,第二轮快速抬升,后续稳定维持在7%~8.3%的稳态区间,无系统性衰减

• TC11初版召回率5.366%,为六轮最低;

• WM0919(A)起指标抬升,进入稳态平台;

• WM0921WM0922达到实验组指标高点(召回8.195%8.293%);

• WM0923小幅回落至7.317%,属于正常小幅波动,不属于性能退化。

采信率同步表现:首轮1.366%最低,第二轮起稳定落在3.2%~4.3%区间,采信能力持续稳定。

结论:结构化原子事实的内生检索增强能力,在6轮平行复测(累计6150次查询)中完成收敛,进入稳态平台期。

5.3.2 长文基线(对照组绝对指标)趋势

长文基线整体呈现下行波动趋势:

TC11初版(1.561%) → WM0919(A)(1.659%) → WM0920(B)(2.049%)峰值 持续下滑:WM0921(1.171%) → WM0922(0.390%)低位 → WM0923小幅回升至0.585%

长文基线属于外部变量,受搜索引擎索引快照权重影响,不受万象元驱/原子事实范式控制。

5.3.3 模型分层趋势

每模型单轮固定205次查询,5模型合计1025次查询/轮。

• 无效检索层:元宝、Kimi,全程召回=0

• 高敏校验层:千问,高召回、极低采信,特征稳定;

• 高稳适配层:文心、豆包;豆包保持召回即采信,转化率100%

模型分层在第一轮实验后即收敛,后续轮次不再改变模型层级归属,模型调用策略可固化量产。

5.3.4 渠道趋势

渠道黑白名单全程收敛稳定:

• 永久盲区:官网、公众号、头条号,六轮持续召回为0,属于结构性不可检索渠道;

• 有效渠道:百家号、搜狐号、网易号。搜狐号贡献绝大多数召回与采信;网易号召回尚可、采信转化率偏低;百家号仅零星命中。

渠道分布特征在多轮复测无漂移,渠道权重配置策略可固定。

5.4 趋势总判断

六轮复测呈现原子事实绝对指标稳态平台、长文基线随搜索引擎环境持续波动、单轮相对增益随基线反向放大的特征;内生检索增强能力稳定无衰减,模型分层、渠道特征在早期即完成收敛。基于全部6150次查询汇总,结构化原子事实相较传统长文素材,综合召回提升482.8%,综合采信提升252.7%

绘图建议(折线图4条曲线)

1. 曲线1:原子事实召回率(高位平稳小幅震荡)

2. 曲线2:长文召回率(整体下行、波动)

3. 曲线3:召回相对提升(剧烈震荡,WM0923尖峰)

4. 曲线4:采信相对提升(剧烈震荡,WM0923尖峰)

6 核心实验结论

1. 本实验由北京奥美地亚科技有限公司万象镜·中国AI认知治理实验室开展,累计执行6150次查询,六轮平行对照复测,实验组结构化原子事实在全部轮次均优于传统长文对照组,零负向反转,验证方案有效性。

2. 基于全量查询合并统计(主结论指标):相比传统长文网页素材,结构化原子事实综合召回提升482.8%、综合采信提升252.7%;若采用轮次算术平均口径,六轮平均召回提升463.2%、平均采信提升333.9%。推荐优先使用全量合并指标,规避单轮基线过低带来增益虚高。

3. 万象元驱(MDSE元驱凝铸)+结构化原子事实的检索增强架构,具备稳定内生检索增益,不受搜索引擎快照外部波动影响,系统鲁棒性强,可适配真实互联网动态检索环境。

4. 模型分层、渠道筛选、长短素材对照策略全部收敛固化,方案技术路线稳定,具备工程落地与规模化量产条件。

7 讨论与说明

1. 单轮相对提升率的剧烈波动,由外部搜索引擎索引快照权重变化、对照组长文基线波动造成,不是本检索增强系统性能变化。在评价系统整体能力时,不建议单独使用某一轮的高增益作为核心结论。

2. 实验严格遵循单变量对照、随机分配、可重复复测、混杂因素识别控制的科学实验原则,每次仅更换素材类型,其余实验条件保持不变,保证归因可靠。

3. 素材来源限定为搜狐、网易号,剔除百家号、头条、官网噪声渠道,减少低质量网页噪声对对照组的干扰。

4. 采信指标依赖召回成功,采信率建立在召回成功的基础上,符合检索增强任务业务逻辑。

8 附录

TC11六轮平行权威复测,由北京奥美地亚科技有限公司万象镜·中国AI认知治理实验室完成,累计6150次查询验证:万象元驱检索增强体系赋能结构化原子事实,实现六轮数据零反转、全维度正向增益;基于全部查询样本汇总测算,结构化原子事实对比传统长文内容,综合召回提升482.8%、综合采信提升252.7%;多轮迭代模型层级完全固化、渠道特征高度收敛,结构化事实驱动AI检索增强的技术路线稳定成立、具备标准化量产能力。