TC11 检索增强专项实验(WM0919 / WM0920 + 原始首轮)三轮合并对照分析报告

实验背景:TC11 检索增强专项,三轮独立平行复测,用于评估指标稳定性、结论可复现性
实验基线:单轮 = 1025 轮查询(205 轮 / 模型 × 元宝、千问、文心、Kimi、豆包,5 款模型);6 平台、12 篇监测样本
统计口径:

1. 召回命中:引用证据命中该监测文档的轮次数

2. 采信命中:命中轮次中判定采信,采信必须以召回为前置

3. 业务评价原则:优先参考召回体量 + 全量采信产出,不采信转化率做跨样本对比

4. 样本形态:原子事实(信任百科结构化)VS 原生长文

5. 有效渠道:搜狐号、网易号、百家号;官网 / 公众号 / 头条三轮全形态召回均为 0,属于检索盲区,不计入核心对比

三轮原始批次清单

• 首轮:TC11 初版

• WM0919:批次 A

• WM0920:批次 B

一、三轮分平台明细汇总(5 模型合并,单轮基线 1025 查询)

首轮(TC11 初版)

平台

样本形态

查询轮次

召回命中

采信命中

召回率

采信率

官网

原子事实

1025

0

0

0.00%

0.00%

官网

长文

1025

0

0

0.00%

0.00%

公众号

原子事实

1025

0

0

0.00%

0.00%

公众号

长文

1025

0

0

0.00%

0.00%

头条号

原子事实

1025

0

0

0.00%

0.00%

头条号

长文

1025

0

0

0.00%

0.00%

百家号

原子事实

1025

1

1

0.098%

0.098%

百家号

长文

1025

2

2

0.195%

0.195%

搜狐号

原子事实

1025

11

5

1.073%

0.488%

搜狐号

长文

1025

1

0

0.098%

0.000%

网易号

原子事实

1025

43

8

4.195%

0.780%

网易号

长文

1025

13

9

1.268%

0.878%

有效渠道合计(百家 + 搜狐 + 网易)

原子事实

1025

55

14

5.366%

1.366%

 

长文

1025

16

11

1.561%

1.073%

WM0919(批次 A

平台

样本形态

查询轮次

召回命中

采信命中

召回率

采信率

官网

原子事实

1025

0

0

0.00%

0.00%

官网

长文

1025

0

0

0.00%

0.00%

公众号

原子事实

1025

0

0

0.00%

0.00%

公众号

长文

1025

0

0

0.00%

0.00%

头条号

原子事实

1025

0

0

0.00%

0.00%

头条号

长文

1025

0

0

0.00%

0.00%

百家号

原子事实

1025

0

0

0.00%

0.00%

百家号

长文

1025

2

2

0.195%

0.195%

搜狐号

原子事实

1025

51

33

4.976%

3.219%

搜狐号

长文

1025

1

0

0.098%

0.000%

网易号

原子事实

1025

26

5

2.537%

0.488%

网易号

长文

1025

14

13

1.366%

1.268%

有效渠道合计(百家 + 搜狐 + 网易)

原子事实

1025

77

38

7.512%

3.707%

 

长文

1025

17

15

1.659%

1.463%

WM0920(批次 B

平台

样本形态

查询轮次

召回命中

采信命中

召回率

采信率

官网

原子事实

1025

0

0

0.00%

0.00%

官网

长文

1025

0

0

0.00%

0.00%

公众号

原子事实

1025

0

0

0.00%

0.00%

公众号

长文

1025

0

0

0.00%

0.00%

头条号

原子事实

1025

0

0

0.00%

0.00%

头条号

长文

1025

0

0

0.00%

0.00%

百家号

原子事实

1025

0

0

0.00%

0.00%

百家号

长文

1025

2

2

0.195%

0.195%

搜狐号

原子事实

1025

40

26

3.902%

2.537%

搜狐号

长文

1025

2

0

0.195%

0.000%

网易号

原子事实

1025

27

7

2.634%

0.683%

网易号

长文

1025

17

17

1.659%

1.659%

有效渠道合计(百家 + 搜狐 + 网易)

原子事实

1025

67

33

6.537%

3.219%

 

长文

1025

21

19

2.049%

1.854%

二、三轮有效渠道汇总对比 & 稳定性评估表

批次

形态

召回命中

采信命中

召回率

采信率

召回率相对提升(原子事实 vs 长文)

采信率相对提升(原子事实 vs 长文)

首轮 TC11 初版

原子事实

55

14

5.366%

1.366%

244%

27.3%

首轮 TC11 初版

长文

16

11

1.561%

1.073%

WM0919(A)

原子事实

77

38

7.512%

3.707%

352.9%

153.4%

WM0919(A)

长文

17

15

1.659%

1.463%

WM0920(B)

原子事实

67

33

6.537%

3.219%

219.0%

73.6%

WM0920(B)

长文

21

19

2.049%

1.854%

三轮均值

原子事实

66.33

28.33

6.472%

2.764%

267.6%

84.8%

三轮均值

长文

18

15

1.756%

1.463%

 

稳定性定性说明:

1. 原子事实召回率:5.366% ~7.512%,波动区间 ±1.046 个百分点,波动属于中等小幅波动,方向稳定;

2. 长文召回率:1.561% ~2.049%,波动很小,基线稳定;

3. 原子事实采信率:1.366% ~3.707%,波动偏大;推测是搜狐号在首轮的采信产出偏低(首轮搜狐原子事实采信仅 5),后两轮搜狐采信大幅抬升,是主要波动来源;

4. 核心结论方向三轮完全一致:原子事实召回、采信,每一轮都优于长文,无反向反转,主结论稳定成立。

三、三轮分模型汇总(单批次基线:每模型 205 轮查询)

模型

首轮召回 / 采信

WM0919 召回 / 采信

WM0920 召回 / 采信

三轮合计召回 / 采信

模型分层 & 稳定性评价

元宝

0/0

0/0

0/0

0/0

无效检索层:三轮全程 0 产出,行为完全稳定,不兼容检索增强链路

Kimi

0/0

0/0

0/0

0/0

无效检索层:三轮全程 0 产出,行为完全稳定,不兼容检索增强链路

千问

49/3

42/2

37/1

128/6

高敏校验层:三轮均为高召回、极低采信;召回小幅逐轮下降,采信始终极低,模型校验机制行为稳定

文心

4/4

4/3

3/3

11/10

高稳适配层:召回体量小,召回即采信,采信损耗几乎为 0,行为稳定

豆包

18/18

48/48

48/48

114/114

高稳适配层:100% 采信率稳定不变;首轮召回偏低,0919/0920 两轮召回拉满并保持恒定,模型适配能力验证稳定

 

模型行为稳定性评价:

1. 分层结构三轮完全不变,分层顺序没有发生任何翻转,分层结论高度可复现;

2. 元宝、Kimi 全程零产出,无异常跳变;

3. 豆包只要产生召回,全部采信,采信规则稳定;首轮豆包召回偏低属于单次波动,后两轮复测保持稳定;

4. 千问 召回量大、采信极少的特征三轮持续一致。

四、渠道表现三轮稳定性分析

1. 搜狐号:原子事实 > 长文,三轮一致;
首轮搜狐原子事实召回 11,采信仅 5WM0919/WM0920 召回、采信显著提升,是三轮中最大波动来源。长文搜狐三轮几乎无采信,特性稳定。

2. 网易号:原子事实召回全部高于长文;网易长文采信能力持续较强,三轮都呈现这个特征,渠道属性稳定。

3. 百家号:长文稳定产出少量命中,原子事实仅首轮出现 1 次命中,后两轮为 0;基数极低,不影响整体结论。

4. 官网 / 公众号 / 头条号:三轮全部 0 召回,稳定属于检索盲区。

五、三轮实验综合核心结论(稳定性结论重点)

结论 1主结论三轮完全可复现,无反向反转
三轮独立平行测试,每一轮原子事实(信任百科)的召回率、采信率均优于原生长文。三轮平均召回相对提升 267.6%,采信率平均提升 84.8%,证明万象元驱检索增强赋能结构化原子事实的技术增益是真实效应,不是单次偶然结果。

结论 2:指标存在小幅批次波动,波动来源定位清晰
波动主要来自搜狐号的采信产出,首轮搜狐原子事实采信偏低,0919/0920 两轮搜狐采信明显抬升;其余渠道、长文基线指标波动很小。

解释推测:搜索引擎检索索引快照、内容权重存在日内自然波动,属于外部环境噪声,不是技术路线失效。优势方向没有反转,不否定核心结论

结论 3:大模型分层行为高度稳定,三轮分层结构完全不变
元宝、Kimi 全程无检索产出;千问高召回低采信;文心、豆包召回即采信。
模型适配分层规律三轮没有发生任何反转,证明结构化原子事实库存在刚性模型选型门槛,分层结论具备强可复现性。

结论 4:渠道特征稳定,渠道属性不随轮次反转
搜狐号是结构化事实的优势渠道;网易号长文采信能力较强;百家号贡献极低;官网 / 公众号 / 头条属于检索盲区,三轮渠道规律一致。

六、最终实验总结

TC11 检索增强专项实验完成三轮独立平行复测,用于验证万象元驱 + 信任百科原子事实技术路线的稳定性。三轮基线统一为 1025 轮查询,5 模型覆盖元宝、千问、文心、Kimi、豆包。
三轮实测:每一轮原子事实召回、采信指标均优于原生长文,结论方向无反转;三轮均值:召回相对提升 267.6%,采信相对提升 84.8%
指标存在小幅批次波动,波动主要来自搜狐号采信产出,属于外部检索环境噪声;大模型分层、渠道优劣特征三轮稳定不变
综合判定:检索增强赋能结构化原子事实的增益效应稳定可复现,技术路线成立,业务价值得到三轮实验持续验证。

七、金句(三轮稳定性终版)

TC11 三轮平行复测验证:万象元驱赋能信任百科原子事实,三轮结论无反转,平均召回提升 267.6%、采信提升 84.8%;模型分层、渠道特征稳定可复现,结构化事实技术路线成立。

八、稳定性补充分析段落

三轮实验观察到批次间存在一定指标波动,主要来源于搜索引擎侧索引快照、网页权重的动态变化,属于外部环境混杂因素,并非检索增强与原子事实范式本身的缺陷。在存在外部噪声的前提下,三轮全部保持 原子事实优于长文的单向结论,证明该效应鲁棒性较强;后续可通过增加更多轮次,进一步压缩随机噪声,缩小指标波动区间。