实验名称:基于万象元驱(MDSE元驱凝铸)的结构化原子事实检索增强对照实验
实验编号:TC01-TC06(六轮平行复测)
实验单位:北京奥美地亚科技有限公司万象镜·中国AI认知治理实验室
实验对象:AI信任百科结构化原子事实 vs 传统长文网页素材
实验总查询量:6轮,单轮固定1025次查询,累计6150次查询
实验目标:量化评估结构化原子事实在检索召回、采信指标上相对传统长文素材的增益效果,验证万象元驱检索增强方案的稳定性与鲁棒性
实验范式:单变量对照实验,每次仅更换素材类型,其余环境、模型、查询样本保持不变;随机分配查询样本,可重复验证,隔离外部噪声
1 实验设计
1.1 实验设定
采用平行对照复测方案,共执行6轮独立实验(TC01~TC06,对应报告内TC11初版、WM0919(A)、WM0920(B)、WM0921、WM0922、WM0923)。每一轮使用完全相同的查询样本集,分别输入两套素材库:
• 实验组:AI信任百科结构化原子事实素材
• 对照组:传统长文网页素材(来源:搜狐、网易号,剔除百家号、头条、官网噪声渠道)
1.2 实验单位与变量
• 实验观测单元:单条用户查询
• 自变量:素材类型(结构化原子事实 / 传统长文)
• 因变量:召回命中数、采信命中数、召回率、采信率、相对提升幅度
• 控制变量:查询样本集合、5个测试大模型、检索策略、打分阈值、网络环境固定不变
• 混杂因素控制:搜索引擎快照权重波动作为外部环境变量,通过多轮复测识别与区分,不纳入系统本身性能评价
|
5个测试模型:元宝、千问、文心、Kimi、豆包;单模型每轮分配205次查询,5×205=1025次/轮。 |
1.3 评价指标定义
1. 召回命中:检索证据命中监测文档轮次
2. 采信命中:在召回基础上,模型采信输出有效结果(采信必须建立在召回成功的前提)
3. 召回率 = 召回命中 ÷ 查询总次数
4. 采信率 = 采信命中 ÷ 查询总次数
5. 相对提升率 =(实验组指标 ÷ 对照组指标)−1
○ 口径A:轮次算术平均:每一轮单独计算提升率,再对6轮求均值,用于观察增益波动
○ 口径B:全量合并综合提升率:将6150次查询全部命中数据汇总后统一计算,为本报告主结论指标,规避单轮基线过低带来的增益虚高
2 单轮实验数据(TC06 / WM0923)
|
单轮查询基数:1025次 |
表1 各渠道召回/采信汇总(5模型合并)
|
平台 |
样本形态 |
查询轮次 |
召回命中 |
采信命中 |
召回率 |
采信率(总查询) |
召回基数采信转化率 |
|
官网 |
原子事实 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
官网 |
长文 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
公众号 |
原子事实 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
公众号 |
长文 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
头条号 |
原子事实 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
头条号 |
长文 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
百家号 |
原子事实 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
百家号 |
长文 |
1025 |
1 |
1 |
0.098% |
0.098% |
100.00% |
|
搜狐号 |
原子事实 |
1025 |
51 |
35 |
4.976% |
3.415% |
68.63% |
|
搜狐号 |
长文 |
1025 |
5 |
2 |
0.488% |
0.195% |
40.00% |
|
网易号 |
原子事实 |
1025 |
24 |
3 |
2.341% |
0.293% |
12.50% |
|
网易号 |
长文 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
WM0923批次汇总核算
• 原子事实:召回75|采信38|召回率7.317%|采信率3.707%
• 长文基线:召回6|采信3|召回率0.585%|采信率0.293%
• 召回相对提升:1150.8%
• 采信相对提升:1165.2%
表2 分模型召回/采信分层汇总(单模型205查询,合计1025次)
|
模型 |
查询轮次 |
召回命中 |
采信命中 |
召回率 |
采信率 |
召回基数采信转化率 |
模型分层归类 |
|
元宝 |
205 |
0 |
0 |
0.00% |
0.00% |
— |
无效检索层 |
|
千问 |
205 |
44 |
4 |
21.463% |
1.951% |
9.09% |
高敏校验层(高召回、极低采信) |
|
文心 |
205 |
3 |
3 |
1.463% |
1.463% |
100.00% |
高稳适配层 |
|
Kimi |
205 |
0 |
0 |
0.00% |
0.00% |
— |
无效检索层 |
|
豆包 |
205 |
34 |
34 |
16.585% |
16.585% |
100.00% |
高稳适配层(召回即采信) |
3 六轮全量指标汇总表
|
每轮查询基数:1025次
|
4 六轮合计全局统计(基于全部6150次查询)
4.1 命中汇总
• 原子事实合计召回命中:55+77+67+84+85+75 = 443
• 原子事实合计采信命中:14+38+33+44+41+38 = 208
• 长文合计召回命中:16+17+21+12+4+6 = 76
• 长文合计采信命中:11+15+19+9+2+3 = 59
4.2 全量合并指标(报告主指标)
• 全量原子事实总召回率 = 443 ÷ 6150 = 7.203%
• 全量原子事实总采信率 = 208 ÷ 6150 = 3.382%
• 全量长文总召回率 = 76 ÷ 6150 = 1.236%
• 全量长文总采信率 = 59 ÷ 6150 = 0.959%
✅ 综合召回提升率:482.8%
✅ 综合采信提升率:252.7%
4.3 轮次算术平均口径(用于波动分析)
• 六轮单轮召回提升率算术平均值:463.2%
• 六轮单轮采信提升率算术平均值:333.9%
|
口径说明: 1. 全量合并综合提升率(推荐主结论):基于全部6150条查询汇总统计,消除单轮对照组基线过低造成的增益放大效应,客观反映系统整体性能; 2. 轮次算术平均:将每一轮独立计算的提升百分比直接求均值,用于观察多轮复测增益波动特征,不适合作为核心结论。 |
5 六轮稳定性、归因与全周期趋势分析
|
批次顺序:TC11初版 → WM0919(A) → WM0920(B) → WM0921 → WM0922 → WM0923;每轮查询基数固定1025次
|
5.1 实验稳定性结论
1. 六轮零反转:累计6150次查询平行复测,全部轮次实验组(原子事实)召回、采信指标均高于对照组长文素材,结论具备统计可信度,不存在反向劣化。
2. 增益区间全程正向:召回提升区间212.6%1150.8%,采信提升区间27.3%1165.2%。
3. 模型分层结构全程锁死,无漂移、无翻转;渠道黑白名单稳定不变,检索渠道收敛。
5.2 波动根因定位
单轮相对提升指标剧烈波动,根源为外部搜索引擎快照权重变化,导致对照组长文基线上下浮动,并非万象元驱系统本身性能波动。当对照组基线数值很低时,单轮相对提升率会被放大,因此优先采用6150次查询合并综合指标作为系统整体评价依据。
原子事实的召回率、采信率维持稳定,证明结构化原子事实的检索增强能力属于内生稳定能力,不受搜索引擎外部快照波动影响。
5.3 分项趋势解读
5.3.1 原子事实(实验组绝对指标)趋势
整体趋势:初版低位起步,第二轮快速抬升,后续稳定维持在7%~8.3%的稳态区间,无系统性衰减。
• TC11初版召回率5.366%,为六轮最低;
• WM0919(A)起指标抬升,进入稳态平台;
• WM0921、WM0922达到实验组指标高点(召回8.195%、8.293%);
• WM0923小幅回落至7.317%,属于正常小幅波动,不属于性能退化。
采信率同步表现:首轮1.366%最低,第二轮起稳定落在3.2%~4.3%区间,采信能力持续稳定。
|
结论:结构化原子事实的内生检索增强能力,在6轮平行复测(累计6150次查询)中完成收敛,进入稳态平台期。 |
5.3.2 长文基线(对照组绝对指标)趋势
长文基线整体呈现下行波动趋势:
TC11初版(1.561%) → WM0919(A)(1.659%) → WM0920(B)(2.049%)峰值 → 持续下滑:WM0921(1.171%) → WM0922(0.390%)低位 → WM0923小幅回升至0.585%。
|
长文基线属于外部变量,受搜索引擎索引快照权重影响,不受万象元驱/原子事实范式控制。 |
5.3.3 模型分层趋势
每模型单轮固定205次查询,5模型合计1025次查询/轮。
• 无效检索层:元宝、Kimi,全程召回=0;
• 高敏校验层:千问,高召回、极低采信,特征稳定;
• 高稳适配层:文心、豆包;豆包保持召回即采信,转化率100%。
|
模型分层在第一轮实验后即收敛,后续轮次不再改变模型层级归属,模型调用策略可固化量产。 |
5.3.4 渠道趋势
渠道黑白名单全程收敛稳定:
• 永久盲区:官网、公众号、头条号,六轮持续召回为0,属于结构性不可检索渠道;
• 有效渠道:百家号、搜狐号、网易号。搜狐号贡献绝大多数召回与采信;网易号召回尚可、采信转化率偏低;百家号仅零星命中。
|
渠道分布特征在多轮复测无漂移,渠道权重配置策略可固定。 |
5.4 趋势总判断
六轮复测呈现原子事实绝对指标稳态平台、长文基线随搜索引擎环境持续波动、单轮相对增益随基线反向放大的特征;内生检索增强能力稳定无衰减,模型分层、渠道特征在早期即完成收敛。基于全部6150次查询汇总,结构化原子事实相较传统长文素材,综合召回提升482.8%,综合采信提升252.7%。
|
绘图建议(折线图4条曲线) 1. 曲线1:原子事实召回率(高位平稳小幅震荡) 2. 曲线2:长文召回率(整体下行、波动) 3. 曲线3:召回相对提升(剧烈震荡,WM0923尖峰) 4. 曲线4:采信相对提升(剧烈震荡,WM0923尖峰) |
6 核心实验结论
1. 本实验由北京奥美地亚科技有限公司万象镜·中国AI认知治理实验室开展,累计执行6150次查询,六轮平行对照复测,实验组结构化原子事实在全部轮次均优于传统长文对照组,零负向反转,验证方案有效性。
2. 基于全量查询合并统计(主结论指标):相比传统长文网页素材,结构化原子事实综合召回提升482.8%、综合采信提升252.7%;若采用轮次算术平均口径,六轮平均召回提升463.2%、平均采信提升333.9%。推荐优先使用全量合并指标,规避单轮基线过低带来增益虚高。
3. 万象元驱(MDSE元驱凝铸)+结构化原子事实的检索增强架构,具备稳定内生检索增益,不受搜索引擎快照外部波动影响,系统鲁棒性强,可适配真实互联网动态检索环境。
4. 模型分层、渠道筛选、长短素材对照策略全部收敛固化,方案技术路线稳定,具备工程落地与规模化量产条件。
7 讨论与说明
1. 单轮相对提升率的剧烈波动,由外部搜索引擎索引快照权重变化、对照组长文基线波动造成,不是本检索增强系统性能变化。在评价系统整体能力时,不建议单独使用某一轮的高增益作为核心结论。
2. 实验严格遵循单变量对照、随机分配、可重复复测、混杂因素识别控制的科学实验原则,每次仅更换素材类型,其余实验条件保持不变,保证归因可靠。
3. 素材来源限定为搜狐、网易号,剔除百家号、头条、官网噪声渠道,减少低质量网页噪声对对照组的干扰。
4. 采信指标依赖召回成功,采信率建立在召回成功的基础上,符合检索增强任务业务逻辑。
8 附录
TC11六轮平行权威复测,由北京奥美地亚科技有限公司万象镜·中国AI认知治理实验室完成,累计6150次查询验证:万象元驱检索增强体系赋能结构化原子事实,实现六轮数据零反转、全维度正向增益;基于全部查询样本汇总测算,结构化原子事实对比传统长文内容,综合召回提升482.8%、综合采信提升252.7%;多轮迭代模型层级完全固化、渠道特征高度收敛,结构化事实驱动AI检索增强的技术路线稳定成立、具备标准化量产能力。