一、实验口径说明
1. 单组标准化查询轮次:1025 轮
2. 召回率 = 召回命中数 ÷ 总查询轮次
3. 采信率(业务最终有效口径)= 采信命中数 ÷ 总查询轮次
4. 本次评价优先级:优先参考召回体量 + 全量采信产出,不参考采信转化率(因两类样本召回量级差距过大,转化率无业务对比意义)
5. 对比样本形态:信任百科(结构化事实库)VS 原文(原生长文内容)
6. 评测模型全域覆盖:元宝、千问、文心、Kimi、豆包五款主流大模型,所有数据为 5 模型合并全域统计结果
二、分平台明细数据
|
平台 |
内容形态 |
召回命中 |
召回率 |
采信命中 |
全量采信率 |
|
百家号 |
信任百科 |
1 |
0.098% |
1 |
0.098% |
|
百家号 |
原文 |
2 |
0.195% |
2 |
0.195% |
|
搜狐号 |
信任百科 |
11 |
1.073% |
5 |
0.488% |
|
搜狐号 |
原文 |
1 |
0.098% |
0 |
0.000% |
|
网易号 |
信任百科 |
43 |
4.195% |
8 |
0.780% |
|
网易号 |
原文 |
13 |
1.268% |
9 |
0.878% |
三、全域汇总对比(有效渠道合计)
1. 信任百科 全域汇总
• 总召回命中:55
• 总采信命中:14
• 全域召回率:5.366%
• 全域采信率:1.366%
2. 原文 全域汇总
• 总召回命中:16
• 总采信命中:11
• 全域召回率:1.561%
• 全域采信率:1.073%
四、核心指标提升幅度(官方终版结论数据)
1. 召回能力提升
• 召回率绝对差值:+3.805 个百分点
• 召回率相对提升:+244%
2. 最终有效采信产出提升
• 采信率绝对差值:+0.293 个百分点
• 采信率相对提升:+27.3%
五、五模型分层实测数据汇总(新增核心维度)
本次 TC11 专项实验基于统一 1025 轮查询基线,完成五大模型信任百科 + 原文双形态全量实测,各模型差异化表现如下:
|
评测模型 |
总查询轮次 |
全域总召回 |
全域总采信 |
模型核心行为特征 |
|
元宝 |
205 |
0 |
0 |
零检索响应,无法识别信任百科结构化数据与原生长文样本,无任何命中产出 |
|
Kimi |
205 |
0 |
0 |
检索链路静默,对本次实验全渠道、全形态内容无召回、无采信 |
|
千问 |
205 |
49 |
3 |
全域召回体量最高,但信任百科与原文内容采信筛选极严苛,高召回、低采信,证据校验保守 |
|
文心 |
205 |
4 |
4 |
召回体量偏低,但证据判定一致性极强,100% 全量采信,无有效召回损耗 |
|
豆包 |
205 |
18 |
18 |
中等稳定召回能力,全域实现100% 采信率,是适配结构化事实库最优模型 |
模型整体分层结论
1. 无效检索层(元宝、Kimi):两款模型未产生任何有效检索命中,对本次实验的结构化信任百科、原生长文内容均无识别能力,不适配本次检索增强技术链路。
2. 高敏校验层(千问):具备最强的内容检索捕捉能力,但内置风控与可信度筛选机制严格,大量检索命中内容被判定为无效证据,有效产出折损严重。
3. 高稳适配层(文心、豆包):两大模型采信准确率拉满,只要完成内容召回即认定为有效可信证据,与结构化原子事实 + 检索增强的技术范式兼容性最高,业务有效产出最稳定。
六、分层实验核心结论
结论 1:检索增强机制对信任百科结构化内容增益极强
启用检索增强后,信任百科整体召回能力较原文提升 244%,结构化事实条目在模型检索链路中具备压倒性的命中优势。
证明:检索增强技术高度适配信任百科轻量化、标准化、结构化的数据范式,能够极大扩宽模型检索的触达范围,突破原生长文检索的识别局限。
结论 2:信任百科整体有效证据产出优于原文
在总查询轮次统一口径下:
信任百科采信率 1.366% > 原文 1.073%,相对提升 27.3%。
说明:更大的召回体量,最终转化为了更多的有效可信证据产出,整体业务收益正向显著,结构化内容范式的商业与业务价值落地性更强。
结论 3:渠道结构特征明确
1. 网易号:为检索增强最大增量来源,信任百科召回能力远超原文,是结构化事实库核心优势渠道。
2. 搜狐号:信任百科优势碾压原文,原文几乎无有效检索与采信产出,结构化内容优势绝对。
3. 百家号:整体命中基数极低,对整体实验结论无干扰、无权重影响。
结论 4:模型适配性差异化显著(新增)
检索增强 + 结构化信任百科技术路线,对豆包、文心模型适配性最优,可实现零召回损耗、全量有效产出;千问可贡献超大召回体量但存在明显采信损耗;元宝、Kimi 暂不兼容该检索增强链路,无业务产出价值。多模型实测进一步验证:结构化事实库并非通用适配所有大模型,存在明确的模型选型适配门槛。
七、最终实验总结
TC11 检索增强专项实验验证得出:
检索增强机制极大强化了信任百科结构化事实的检索能力,相比原生原文,召回率提升 244%、全域有效采信率提升 27.3%。在不参考转化率、仅以真实业务有效产出为标准的前提下,信任百科内容范式的整体检索性能与证据产出能力全面优于原文。
同时通过五大主流模型对照实测,验证了结构化原子事实库 + 检索增强的技术路线具备明确的渠道优势与模型适配规律,彻底证实该技术路线的科学性、有效性与业务落地价值。
八、极简终版金句(升级含模型维度)
检索增强赋能结构化信任百科,召回提升 244%、有效采信提升 27.3%,高适配主流大模型,结构化事实库技术路线完全验证成立。