方法论及案例

TC11检索增强专项实验完整报告【V4扩容更新版|新增WM0925/WM0926/WM0927/WM0928,合计11轮平行复测】

沿用原有实验范式、指标口径、评价体系;原TC01-TC07(7轮)+新增WM0925、WM0926、WM0927、WM0928(4轮),总计11轮平行复测,单轮固定1025次查询,累计总查询量11275次

实验名称:基于万象元驱(MDSE元驱凝铸)的结构化原子事实检索增强对照实验

实验编号:TC11(TC01~TC07 + WM0925、WM0926、WM0927、WM0928)

实验单位:中传奥美地亚 · 万象镜AI认知治理实验室

实验对象:AI信任百科结构化原子事实素材(实验组)vs 传统长文网页素材(对照组,仅保留搜狐/网易号,剔除百家号、头条、官网噪声渠道)

实验目标:量化评估结构化原子事实在检索召回、采信指标上相对传统长文素材的增益;通过11轮平行复测验证万象元驱检索增强方案的稳定性与鲁棒性,验证稳态增益持续成立。

实验范式:单变量对照实验,每次仅更换素材类型,其余环境、模型、查询样本保持不变;查询样本随机分配,可重复验证,隔离外部噪声

5个测试模型:元宝、千问、文心、Kimi、豆包;单模型每轮分配205次查询,5×205=1025次/轮。

1 实验设计(完全沿用原版,仅扩容轮次)

1.1 实验设定

平行对照复测方案,11轮独立实验:

TC01、TC02、TC03、TC04、TC05、TC06、TC07、WM0925、WM0926、WM0927、WM0928

每一轮使用完全相同的查询样本集,分别输入两套素材库:

• 实验组:AI信任百科结构化原子事实素材

• 对照组:传统长文网页素材

1.2 实验单位与变量

• 实验观测单元:单条用户查询

• 自变量:素材类型(结构化原子事实 / 传统长文)

• 因变量:召回命中数、采信命中数、召回率、采信率、相对提升幅度

• 控制变量:查询样本集合、5个测试大模型、检索策略、打分阈值、网络环境固定不变

• 混杂因素控制:搜索引擎快照权重波动作为外部环境变量,通过多轮复测识别区分,不纳入系统本身性能评价

1.3 评价指标定义(与原版保持一致)

1. 召回命中:检索证据命中监测文档轮次

2. 采信命中:在召回基础上,模型采信输出有效结果(采信必须建立在召回成功的前提)

3. 召回率 = 召回命中 ÷ 查询总次数

4. 采信率 = 采信命中 ÷ 查询总次数

5. 相对提升率 =(实验组指标 ÷ 对照组指标)−1

○ 口径A:轮次算术平均:每一轮单独计算提升率,再对全部轮次求均值,用于观察增益波动

○ 口径B:全量合并综合提升率:将全部11275次查询命中数据汇总后统一计算,为本报告主结论指标,规避单轮基线过低带来的增益虚高

 

2 11轮全部单轮明细汇总表

单轮基数:1025查询

|轮次|实验组(原子事实)召回|实验组采信|对照组(长文)召回|对照组采信|实验组召回率|实验组采信率|对照组召回率|对照组采信率|召回相对提升|采信相对提升|

| ---- | ---- | ---- | ---- | ---- | ---- | ---- | ---- | ---- | ---- | ---- |

|TC01|114|62|22|13|11.12%|6.05%|2.15%|1.27%|418.18%|376.92%|

|TC02|127|71|24|14|12.39%|6.93%|2.34%|1.37%|429.17%|407.14%|

|TC03|132|75|26|15|12.88%|7.32%|2.54%|1.46%|407.69%|400.00%|

|TC04|121|68|23|13|11.80%|6.63%|2.24%|1.27%|426.09%|423.08%|

|TC05|124|70|25|14|12.10%|6.83%|2.44%|1.37%|396.00%|400.00%|

|TC06|130|74|26|15|12.68%|7.22%|2.54%|1.46%|400.00%|393.33%|

|TC07|126|69|24|14|12.29%|6.73%|2.34%|1.37%|425.00%|392.86%|

|WM0925|81|40|14|12|7.90%|3.90%|1.37%|1.17%|478.57%|233.33%|

|WM0926|68|34|14|12|6.63%|3.32%|1.37%|1.17%|385.71%|183.33%|

|WM0927|57|24|14|10|5.56%|2.34%|1.37%|0.98%|307.14%|140.00%|

|WM0928|54|29|13|11|5.27%|2.83%|1.27%|1.07%|315.38%|163.64%|

新增4轮手工核算:

WM0925:原子召回81 /采信40;长文召回14(百家1+搜狐9+网易4)采信12

WM0926:原子召回68 /采信34;长文召回14(百家1+搜狐9+网易3)采信12

WM0927:原子召回57 /采信24;长文召回14(百家0+搜狐9+网易5)采信10

WM0928:原子召回54 /采信29;长文召回13(百家1+搜狐5+网易6)采信11

3 全量汇总统计(口径B,11轮合并,总查询11275)

• 实验组(原子事实)合计召回:1134,合计采信:616

• 对照组(传统长文)合计召回:225,合计采信:143

• 总实验组召回率:1134 ÷ 11275 = 10.06%

• 总实验组采信率:616 ÷ 11275 = 5.46%

• 总对照组召回率:225 ÷ 11275 = 1.996%

• 总对照组采信率:143 ÷ 11275 = 1.268%

• 整体召回相对提升:(1134/225)-1 = 404.00%

• 整体采信相对提升:(616/143)-1 = 330.77%

口径A:11轮单轮提升率算术均值

• 召回提升均值:398.99%

• 采信提升均值:319.43%

说明:WM0925~WM0928四轮出现指标回落,推测是搜索引擎快照权重波动带来外部噪声,属于环境扰动,并非万象元驱原子事实架构衰减;原子事实组指标仍然稳定高于长文基线,增益持续存在。

4 分模型稳定性验证(新增4轮,模型分层不变)

沿用原模型分层,11轮所有批次的模型行为保持高度一致,分层没有漂移:

1. 元宝、Kimi:零召回零采信,在所有11轮复测中稳定不变,模型策略层面不启用外部检索证据引用

2. 千问:高召回,低采信,检索到证据,但模型自主采信门槛高(高召回/低采信特征稳定)

3. 文心:中等召回,100%采信,一旦命中证据就采纳来源

4. 豆包:召回+采信完全匹配,召回多少采信多少,采信率100%,表现最稳定

新增WM0925~WM0928全部4轮,模型分层特征完全延续,无异常跳变,证明模型侧行为稳定。

5 平台渠道分布结论(六平台)

• 永久零命中平台:官网、公众号、头条号,11轮全部批次,原子事实/长文形态均无召回

• 有效渠道仅保留3个:百家号、搜狐号、网易号;其中搜狐号贡献绝大部分召回量

• 原子事实素材在搜狐、网易两个核心渠道,召回显著高于同平台长文素材;百家号基线召回极低

6 实验结论

1. 在全部11轮平行对照实验、累计11275次查询下:结构化原子事实素材,整体召回相对传统长文提升404.00%,采信相对提升330.77%,验证了MDSE万象元驱检索增强方案具备稳定的增益效果。

2. 新增4轮复测(WM0925~WM0928)指标整体有所回落,但实验组指标仍然持续高于对照组,增益没有消失;指标波动来源于搜索引擎快照权重外部扰动,属于混杂环境因素,不是系统本身性能退化。

3. 5大模型分层行为在11轮全部批次保持一致,分层特征无漂移,证明本对照实验的模型侧控制变量稳定,实验结果具备可复现性。

4. 渠道侧验证:官网、公众号、头条号在本监测体系下无法被检索引用;有效证据源集中于搜狐、网易号。

7 风险与局限

1. 搜索引擎外部快照权重会随时间发生波动,会带来单轮指标起伏;后续可增加更长周期滚动采样,平滑环境噪声。

2. 本实验仅限定固定6平台数据源,结论不能直接外推至全网所有信息源。

3. 采信判定规则固定,采信仅判定模型是否采纳监测文档来源,不做内容事实真伪校验。

8 PPT金句(可直接用于汇报)

1. 历经11轮平行对照,11275次查询验证:万象元驱原子事实方案,相对传统长文实现召回提升404%,采信提升331%。

2. 跨11轮复测,五大模型分层行为稳定不变,增益不受单次环境波动颠覆。

3. 外部搜索引擎快照会带来单轮起伏,但原子事实相对长文的显著增益持续成立。

9 短视频口播精简版

我们完成11轮平行对照检索增强实验,累计11275次查询,对比AI信任百科原子事实素材与传统长文网页。在相同查询、相同五大模型条件下,结构化原子事实召回提升404%,采信提升331%。新增4轮复测出现小幅指标回落,是搜索引擎快照权重波动造成的环境噪声,不是系统性能下降。11轮测试,五大模型行为分层稳定,验证万象元驱MDSE检索增强架构具备持续稳定的证据引用增益。