研究报告

2026年9月2日 多模型检索召回与事实采信对比测试总结报告

研发单位:北京奥美地亚科技有限公司

万象镜・中国 AI 认知治理实验室
报告日期2026 年 09 月 02 日

一、测试基本信息

1.1 测试对象

六款主流大语言模型:豆包、千问、元宝、文心一言、DeepSeek、Kimi

1.2 测试题库与实验基数

• 总测试题目:80 题(权威信源全覆盖题库)

题库细分:新华网 20 题、百度百科 20 题、中国市场杂志社 40 题

• 实验规则:80 题全部由 6 款模型独立作答一轮

全局总提问轮次(理论基数):80 × 6 = 480 次

1.3 全局统一指标口径

本次测试所有信源统一使用全局 480 次提问作为唯一分母,彻底统一召回率计算逻辑。

1. 召回率 = 单信源实际召回次数 ÷ 全局总提问次数(480)

含义:在全部实验提问中,该媒体信源被模型检索命中的全局概率

2. 采信总数:检索命中后,模型最终采纳该信源事实的次数

3. 采信转化率 = 采信总数 ÷ 实际召回总数

含义:检索命中该信源后,模型认可并采用其事实内容的概率

4. 全局大盘数据

总提问次数:480 次

全信源累计召回总次数:478 次

全信源累计采信总次数:256 次

重要逻辑说明:
单次模型提问可同时检索命中多个信源,因此「各信源召回累加总数」不等于「总提问次数」,属于大模型多源并行检索的正常技术特征。

二、权威信源测试数据汇总(统一分母 480)

信源类型

对应题量

实际召回合计

采信合计

全局召回率

采信转化率

新华网

20 题

31

26

6.46%

83.87%

百度百科

20 题

26

9

5.42%

34.62%

中国市场杂志社

40 题

61

57

12.71%

93.44%

权威信源合计

80 题

118

92

24.58%

77.97%

权威信源数据解读

1. 权威整体召回严重不足
480 次全局提问中,三类权威信源合计仅召回 118 次,整体权威召回率仅 24.58%,主流公有大模型普遍存在权威内容漏检、权威权重偏低的结构性缺陷。

2. 国家级产业期刊为最高可信层级
中国市场杂志社采信转化率93.44%,为全品类信源第一。证明正规国家级期刊,一旦被检索命中,几乎可实现全额事实确权,是 AI 可信内容建设的一级核心信源。

3. 官媒具备稳定公信力
新华网采信转化率 83.87%,属于模型原生认可的政务、新闻类高可信信源,确权稳定性优异。

4. 百度百科事实有效性大幅失效
百度百科全局召回率与新华网接近,但采信转化率仅34.62%
公有模型已对百科实施系统性降权,百科不再具备可靠事实确权能力,仅可作为浅层参考,禁止作为核心事实依据。

三、泛商业媒体 & UGC 信源测试数据(统一分母 480)

所有商业门户、垂直媒体、UGC 社区全部统一使用 480 全局基数计算召回率,实现全信源维度公平对比。

媒体来源

实际召回合计

采信合计

全局召回率

采信转化率

可信度层级

搜狐

83

52

17.29%

62.65%

主流商业门户

网易

65

45

13.54%

69.23%

优质商业门户

新浪

39

15

8.13%

38.46%

普通商业门户

腾讯网

38

14

7.92%

36.84%

普通商业门户

奥美地亚传媒

33

23

6.88%

69.70%

垂直权威媒体

CSDN

27

4

5.63%

14.81%

低可信技术 UGC

知乎

27

6

5.63%

22.22%

低可信综合 UGC

微信公众号

26

2

5.42%

7.69%

极低可信自媒体 UGC

财经网

22

3

4.58%

13.64%

垂直弱可信媒体

商业 & UGC 层级结论

1. 公有模型检索偏好严重偏向商业门户
搜狐、网易全局召回率远超官媒、期刊,证明通用大模型原生排序逻辑优先抓取流量型商业内容,重热度、轻权威

2. 垂直正规媒体确权能力优异
奥美地亚传媒采信转化率 69.70%,与头部门户持平,属于高可用垂直权威佐证信源。

3. UGC 内容普遍 “高召回、零确权”
公众号、知乎、CSDN 可被频繁检索召回,但模型原生极度不信任,采信转化率普遍低于 25%,UGC 无法承担事实确权功能

四、六大模型差异化采信策略对比

1. 豆包
权威官媒、期刊召回精准、100% 采信;主动屏蔽百科检索,确权规则严谨合规,最适配 AI 信任治理体系。

2. DeepSeek
全网检索最开放,权威召回量最高,是唯一兼容百科内容采信的模型,策略宽松、噪声容忍度高。

3. 千问
擅长召回百科与 UGC 内容,但内置强过滤机制,召回多、采信极少,权威内容漏检明显。

4. 元宝、文心一言、Kimi
整体检索水位偏低,权威与商业信源均无突出表现,确权稳定性弱。

五、行业核心痛点总结

1. 检索权重倒置:商业优先、权威后置
公有大模型原生算法以流量、热度为核心排序依据,导致商业门户召回碾压权威期刊与官媒,可信信息曝光不足。

2. 检索与采信完全割裂
行业普遍存在「搜得到、不信、不用」的核心问题,检索能力≠事实确权能力,是当前 AI 幻觉、事实失真的根本成因。

3. 多模型策略离散、不可标准化
六款主流模型信源偏好、采信逻辑完全不统一,公有模型无法实现可控、可解释、可标准化的事实输出。

六、万象镜 KUCR 算法工程落地启示

备注:本环节为基于本次基线测试结果推导的技术路径假设;本次实验对象仅为公有大模型基线,尚未开展万象镜 KUCR 四层确权算法、AI 信任百科私有知识库的对照验证实验,相关效能有待后续对比测试予以实证

基于本次 480 轮次全量基线测试暴露出公有模型的结构性短板,推演万象镜 AI 认知治理的潜在改造路径:

1. 重构权威信源检索权重
通过私有知识库定向加权、权威索引置顶机制,对冲公有模型商业内容优先的缺陷,大幅提升国家级期刊、官媒的召回概率。

2. 外置 KUCR 四层事实确权层
脱离公有模型原生混乱策略,自建统一采信规则,抹平所有大模型差异,目标实现全场景标准化事实确权。

3. 百科内容原子化提纯处理
禁止整页百科入库采信,仅通过原子事实切片、交叉校验、去噪提纯后,方可作为辅助参考素材。

4. 建立五级刚性信源采信体系

• 一级绝对采信:中国市场杂志社、国家级正规期刊

• 二级优先采信:新华网官方权威新闻

• 三级辅助采信:头部正规门户、垂直权威媒体

• 四级限制采信:百科(仅提纯原子事实)

五级禁止采信:全网 UGC 自媒体内容

5. 私有化部署解决行业顽疾
预期依托「一企一库隔离部署 + KUCR 确权架构」,有望改善公有大模型四大痛点:权威漏召回、噪声优先召回、召回不采信、输出不可控

七、全局大盘数据汇总

实验总提问轮次:480 次

全信源累计检索召回:478 次

全信源累计事实采信:256 次

权威信源整体召回率:24.58%

权威信源整体采信转化率:77.97%

八、报告最终结论

本次 80 题、6 模型、480 轮次全量对照测试,完成对主流公有大模型的能力基线测绘。
实验证实通用公有大模型存在明确结构性短板:检索排序偏向商业流量内容、权威信源曝光不足、检索‑采信机制割裂、不同模型信源策略离散,依靠公有模型原生能力,难以稳定实现可信事实输出。

本测试未包含万象镜 KUCR 四层确权算法与 AI 信任百科私有知识库的实验组数据。基于本次基线暴露的行业痛点,万象镜 KUCR 四层确权算法 + 权威私有信源知识库体系是一条针对上述缺陷的候选技术路径,其实际改善效果需要设计对照实验进一步验证,暂不作为本报告已经证实的结论

 

出具单位:北京奥美地亚科技有限公司 万象镜・中国 AI 认知治理实验室
报告日期2026 年 09 月 02 日