|
修订说明:作废C0921,WM0922为第五轮;全部5轮均为1025查询,原子事实+长文对照,口径统一。 统计口径: 召回命中=检索证据命中监测文档轮次;采信命中=召回基础上模型采信输出;采信前置依赖召回。 ✅ 提升幅度定义(固定,全文统一):以同批次长文作为基线,原子事实相对长文的提升幅度
|
批次清单
1. TC11初版|1025轮
2. WM0919(A)|1025轮
3. WM0920(B)|1025轮
4. WM0921|1025轮
5. WM0922(第五轮,世界模型+万象元驱)|1025轮
一、第五轮 WM0922 单轮明细
表1 各平台召回/采信汇总(5模型合并,1025查询)
|
平台 |
样本形态 |
查询轮次 |
召回命中 |
采信命中 |
召回率 |
采信率(总查询) |
召回基数采信转化率 |
|
官网 |
原子事实 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
官网 |
长文 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
公众号 |
原子事实 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
公众号 |
长文 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
头条号 |
原子事实 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
头条号 |
长文 |
1025 |
0 |
0 |
0.00% |
0.00% |
— |
|
百家号 |
原子事实 |
1025 |
2 |
2 |
0.195% |
0.195% |
100.00% |
|
百家号 |
长文 |
1025 |
1 |
1 |
0.098% |
0.098% |
100.00% |
|
搜狐号 |
原子事实 |
1025 |
59 |
36 |
5.756% |
3.512% |
61.02% |
|
搜狐号 |
长文 |
1025 |
2 |
0 |
0.195% |
0.000% |
0.00% |
|
网易号 |
原子事实 |
1025 |
24 |
3 |
2.341% |
0.293% |
12.50% |
|
网易号 |
长文 |
1025 |
1 |
1 |
0.098% |
0.098% |
100.00% |
表2 分模型召回/采信汇总(12篇合并,单模型205查询)
|
模型 |
查询轮次 |
召回命中 |
采信命中 |
召回率 |
采信率 |
召回基数采信转化率 |
TC11模型分层归类 |
|
元宝 |
205 |
0 |
0 |
0.00% |
0.00% |
— |
无效检索层 |
|
千问 |
205 |
50 |
5 |
24.390% |
2.439% |
10.00% |
高敏校验层(高召回、极低采信) |
|
文心 |
205 |
5 |
4 |
2.439% |
1.951% |
80.00% |
高稳适配层 |
|
Kimi |
205 |
0 |
0 |
0.00% |
0.00% |
— |
无效检索层 |
|
豆包 |
205 |
34 |
34 |
16.585% |
16.585% |
100.00% |
高稳适配层(召回即采信) |
二、五轮核心指标总表
|
计算规则:同批次内,以长文指标为基线,计算原子事实相对提升 |批次|形态|召回命中|采信命中|召回率|采信率|召回相对提升|采信相对提升| | ---- | ---- | ---- | ---- | ---- | ---- | ---- | ---- | |TC11初版|原子事实|55|14|5.366%|1.366%|244.0%|27.3%| |TC11初版|长文|16|11|1.561%|1.073%|基线|基线| |WM0919(A)|原子事实|77|38|7.512%|3.707%|352.9%|153.4%| |WM0919(A)|长文|17|15|1.659%|1.463%|基线|基线| |WM0920(B)|原子事实|67|33|6.537%|3.219%|219.0%|73.6%| |WM0920(B)|长文|21|19|2.049%|1.854%|基线|基线| |WM0921|原子事实|84|44|8.195%|4.293%|600.0%|388.9%| |WM0921|长文|12|9|1.171%|0.878%|基线|基线| |WM0922(第五轮)|原子事实|85|41|8.293%|4.000%|212.6%|194.9%| |WM0922(第五轮)|长文|4|2|0.390%|0.195%|基线|基线| |
五轮均值基准(核心汇总)
|
形态 |
平均召回命中 |
平均采信命中 |
平均召回率 |
平均采信率 |
平均相对提升 |
|
原子事实 |
73.6 |
34.0 |
7.182% |
3.337% |
召回提升325.7%,采信提升167.6% |
|
长文 |
14.0 |
11.2 |
1.370% |
1.094% |
基线 |
|
说明:平均相对提升 = 5轮各自相对提升幅度的算术平均值 5轮召回相对提升:(244.0%+352.9%+219.0%+600.0%+212.6%)/5 = 325.7% 5轮采信相对提升:(27.3%+153.4%+73.6%+388.9%+194.9%)/5 = 167.6% |
三、第五轮WM0922指标解读
1. WM0922原子事实召回率8.293%,采信率4.000%,维持高位;相对长文基线召回提升212.6%、采信提升194.9%。
2. 本轮长文基线本身大幅压低(长文召回率仅0.390%),但原子事实仍保持显著正向增益;本轮提升幅度低于WM0921峰值,属于搜索引擎长文索引权重短期扰动,原子事实效能没有衰减。
3. 模型分层继续保持完全稳定,无层级翻转。
四、五轮指标稳定性 & 波动归因
4.1 稳定性判定
1. 五轮零反转:每一轮原子事实的召回率、采信率、相对提升幅度全部为正数,无任何一轮低于长文基线,主结论具备强统计学鲁棒性。
2. 相对提升区间:召回相对提升212.6% ~ 600.0%;采信相对提升27.3% ~ 388.9%,全部为正向增益。WM0921为增益峰值;WM0922维持显著正向提升。
3. 模型分层结构五轮完全不变,层级无翻转,特征无漂移,可固化选型策略。
4.2 波动根因(提升幅度波动来源)
1. 提升幅度波动,主要来自长文基线本身的搜索引擎快照权重波动,不是原子事实检索增强能力衰减。
○ WM0921长文基线最低(1.171%),放大了相对提升,出现峰值600%召回提升、388.9%采信提升;
○ WM0922长文基线进一步压低至0.390%,但原子事实绝对指标依然保持高位,相对提升回落至212.6%;
2. 次要混杂因子:搜狐、网易自媒体平台索引快照、网页权重日内浮动;
3. 盲区稳定:官网/公众号/头条号五轮恒0,结构性不可检索域,不影响实验效度。
五、五轮合并终极核心结论
1. 结构化原子事实带来稳定、显著的检索增强增益:五轮平行复测,信任百科结构化原子事实对比原生长文,平均召回提升325.7%、平均采信提升167.6%;每一轮相对提升均为正向,无反转。WM0921达到增益峰值(召回+600.0%,采信+388.9%),WM0922叠加世界模型+万象元驱架构,仍然维持大幅正向增益。该效应为确定性技术效应,非随机噪声。
2. 增益幅度波动主要由长文基线的外部搜索引擎索引波动驱动,原子事实的绝对召回、采信指标持续稳定高位,系统鲁棒性强,适配真实互联网检索环境。
3. 模型分层体系完全固化:五大模型适配层级五轮无变动,形成可落地的模型选型、调用策略,具备工程量产价值。
4. 渠道范式收敛锁定:有效渠道、永久检索盲区、长短内容适配特征全部收敛,为语料入库、渠道权重配置、检索策略调优提供固定基线。
六、更新金句
TC11五轮平行复测权威验证:万象元驱检索增强赋能信任百科原子事实,五轮结论零反转;结构化原子事实相对原生长文平均召回提升325.7%、平均采信提升167.6%,峰值轮次实现召回提升600%、采信提升388.9%;叠加世界模型架构持续维持显著增益,模型分层、渠道特征高度固化,结构化事实驱动的AI检索增强技术路线完全成立、稳定可量产。
七、讨论章节
五轮实验中,相对提升幅度的波动,主要来源于长文对照组的搜索引擎动态索引、快照更新、网页权重自然迭代等外部混杂因素,并非万象元驱与原子事实范式本身性能衰减。
五轮全部维持原子事实相对长文的正向增益,证明该技术路线具备高鲁棒性。原子事实的绝对召回、采信指标在多轮迭代中保持高位,验证结构化事实是稳定提升检索增强召回与采信产出的核心手段;相对提升幅度可作为本技术方案核心业务评价指标。