TC11 检索增强专项实验——信任百科VS原文 对比分析报告(全模型终版)

一、实验口径说明

1. 单组标准化查询轮次:1025

2. 召回率 = 召回命中数 ÷ 总查询轮次

3. 采信率(业务最终有效口径)= 采信命中数 ÷ 总查询轮次

4. 本次评价优先级:优先参考召回体量 + 全量采信产出,不参考采信转化率(因两类样本召回量级差距过大,转化率无业务对比意义)

5. 对比样本形态:信任百科(结构化事实库)VS 原文(原生长文内容)

6. 评测模型全域覆盖:元宝、千问、文心、Kimi、豆包五款主流大模型,所有数据为 5 模型合并全域统计结果

二、分平台明细数据

平台

内容形态

召回命中

召回率

采信命中

全量采信率

百家号

信任百科

1

0.098%

1

0.098%

百家号

原文

2

0.195%

2

0.195%

搜狐号

信任百科

11

1.073%

5

0.488%

搜狐号

原文

1

0.098%

0

0.000%

网易号

信任百科

43

4.195%

8

0.780%

网易号

原文

13

1.268%

9

0.878%

三、全域汇总对比(有效渠道合计)

1. 信任百科 全域汇总

• 总召回命中:55

• 总采信命中:14

• 全域召回率:5.366%

• 全域采信率:1.366%

2. 原文 全域汇总

• 总召回命中:16

• 总采信命中:11

• 全域召回率:1.561%

• 全域采信率:1.073%

四、核心指标提升幅度(官方终版结论数据)

1. 召回能力提升

• 召回率绝对差值:+3.805 个百分点

• 召回率相对提升:+244%

2. 最终有效采信产出提升

• 采信率绝对差值:+0.293 个百分点

• 采信率相对提升:+27.3%

五、五模型分层实测数据汇总(新增核心维度)

本次 TC11 专项实验基于统一 1025 轮查询基线,完成五大模型信任百科 + 原文双形态全量实测,各模型差异化表现如下:

评测模型

总查询轮次

全域总召回

全域总采信

模型核心行为特征

元宝

205

0

0

零检索响应,无法识别信任百科结构化数据与原生长文样本,无任何命中产出

Kimi

205

0

0

检索链路静默,对本次实验全渠道、全形态内容无召回、无采信

千问

205

49

3

全域召回体量最高,但信任百科与原文内容采信筛选极严苛,高召回、低采信,证据校验保守

文心

205

4

4

召回体量偏低,但证据判定一致性极强,100% 全量采信,无有效召回损耗

豆包

205

18

18

中等稳定召回能力,全域实现100% 采信率,是适配结构化事实库最优模型

模型整体分层结论

1. 无效检索层(元宝、Kimi:两款模型未产生任何有效检索命中,对本次实验的结构化信任百科、原生长文内容均无识别能力,不适配本次检索增强技术链路。

2. 高敏校验层(千问):具备最强的内容检索捕捉能力,但内置风控与可信度筛选机制严格,大量检索命中内容被判定为无效证据,有效产出折损严重。

3. 高稳适配层(文心、豆包):两大模型采信准确率拉满,只要完成内容召回即认定为有效可信证据,与结构化原子事实 + 检索增强的技术范式兼容性最高,业务有效产出最稳定。

六、分层实验核心结论

结论 1:检索增强机制对信任百科结构化内容增益极强

启用检索增强后,信任百科整体召回能力较原文提升 244%,结构化事实条目在模型检索链路中具备压倒性的命中优势。
证明:检索增强技术高度适配信任百科轻量化、标准化、结构化的数据范式,能够极大扩宽模型检索的触达范围,突破原生长文检索的识别局限。

结论 2:信任百科整体有效证据产出优于原文

在总查询轮次统一口径下:
信任百科采信率 1.366% > 原文 1.073%,相对提升 27.3%
说明:更大的召回体量,最终转化为了更多的有效可信证据产出,整体业务收益正向显著,结构化内容范式的商业与业务价值落地性更强。

结论 3:渠道结构特征明确

1. 网易号:为检索增强最大增量来源,信任百科召回能力远超原文,是结构化事实库核心优势渠道。

2. 搜狐号:信任百科优势碾压原文,原文几乎无有效检索与采信产出,结构化内容优势绝对。

3. 百家号:整体命中基数极低,对整体实验结论无干扰、无权重影响。

结论 4:模型适配性差异化显著(新增)

检索增强 + 结构化信任百科技术路线,对豆包、文心模型适配性最优,可实现零召回损耗、全量有效产出;千问可贡献超大召回体量但存在明显采信损耗;元宝、Kimi 暂不兼容该检索增强链路,无业务产出价值。多模型实测进一步验证:结构化事实库并非通用适配所有大模型,存在明确的模型选型适配门槛。

七、最终实验总结

TC11 检索增强专项实验验证得出:
检索增强机制极大强化了信任百科结构化事实的检索能力,相比原生原文,召回率提升 244%、全域有效采信率提升 27.3%。在不参考转化率、仅以真实业务有效产出为标准的前提下,信任百科内容范式的整体检索性能与证据产出能力全面优于原文。
同时通过五大主流模型对照实测,验证了结构化原子事实库 + 检索增强的技术路线具备明确的渠道优势与模型适配规律,彻底证实该技术路线的科学性、有效性与业务落地价值。

八、极简终版金句(升级含模型维度)

检索增强赋能结构化信任百科,召回提升 244%、有效采信提升 27.3%,高适配主流大模型,结构化事实库技术路线完全验证成立。