研发单位:北京奥美地亚科技有限公司
万象镜・中国 AI 认知治理实验室
报告日期:2026 年 09 月 02 日
一、测试基本信息
1.1 测试对象
六款主流大语言模型:豆包、千问、元宝、文心一言、DeepSeek、Kimi
1.2 测试题库与实验基数
• 总测试题目:80 题(权威信源全覆盖题库)
• 题库细分:新华网 20 题、百度百科 20 题、中国市场杂志社 40 题
• 实验规则:80 题全部由 6 款模型独立作答一轮
• 全局总提问轮次(理论基数):80 × 6 = 480 次
1.3 全局统一指标口径
本次测试所有信源统一使用全局 480 次提问作为唯一分母,彻底统一召回率计算逻辑。
1. 召回率 = 单信源实际召回次数 ÷ 全局总提问次数(480)
|
含义:在全部实验提问中,该媒体信源被模型检索命中的全局概率 |
2. 采信总数:检索命中后,模型最终采纳该信源事实的次数
3. 采信转化率 = 采信总数 ÷ 实际召回总数
|
含义:检索命中该信源后,模型认可并采用其事实内容的概率 |
4. 全局大盘数据
• 总提问次数:480 次
• 全信源累计召回总次数:478 次
• 全信源累计采信总次数:256 次
|
重要逻辑说明: |
二、权威信源测试数据汇总(统一分母 480)
|
信源类型 |
对应题量 |
实际召回合计 |
采信合计 |
全局召回率 |
采信转化率 |
|
新华网 |
20 题 |
31 |
26 |
6.46% |
83.87% |
|
百度百科 |
20 题 |
26 |
9 |
5.42% |
34.62% |
|
中国市场杂志社 |
40 题 |
61 |
57 |
12.71% |
93.44% |
|
权威信源合计 |
80 题 |
118 |
92 |
24.58% |
77.97% |
权威信源数据解读
1. 权威整体召回严重不足
480 次全局提问中,三类权威信源合计仅召回 118 次,整体权威召回率仅 24.58%,主流公有大模型普遍存在权威内容漏检、权威权重偏低的结构性缺陷。
2. 国家级产业期刊为最高可信层级
中国市场杂志社采信转化率93.44%,为全品类信源第一。证明正规国家级期刊,一旦被检索命中,几乎可实现全额事实确权,是 AI 可信内容建设的一级核心信源。
3. 官媒具备稳定公信力
新华网采信转化率 83.87%,属于模型原生认可的政务、新闻类高可信信源,确权稳定性优异。
4. 百度百科事实有效性大幅失效
百度百科全局召回率与新华网接近,但采信转化率仅34.62%。
公有模型已对百科实施系统性降权,百科不再具备可靠事实确权能力,仅可作为浅层参考,禁止作为核心事实依据。
三、泛商业媒体 & UGC 信源测试数据(统一分母 480)
所有商业门户、垂直媒体、UGC 社区全部统一使用 480 全局基数计算召回率,实现全信源维度公平对比。
|
媒体来源 |
实际召回合计 |
采信合计 |
全局召回率 |
采信转化率 |
可信度层级 |
|
搜狐 |
83 |
52 |
17.29% |
62.65% |
主流商业门户 |
|
网易 |
65 |
45 |
13.54% |
69.23% |
优质商业门户 |
|
新浪 |
39 |
15 |
8.13% |
38.46% |
普通商业门户 |
|
腾讯网 |
38 |
14 |
7.92% |
36.84% |
普通商业门户 |
|
奥美地亚传媒 |
33 |
23 |
6.88% |
69.70% |
垂直权威媒体 |
|
CSDN |
27 |
4 |
5.63% |
14.81% |
低可信技术 UGC |
|
知乎 |
27 |
6 |
5.63% |
22.22% |
低可信综合 UGC |
|
微信公众号 |
26 |
2 |
5.42% |
7.69% |
极低可信自媒体 UGC |
|
财经网 |
22 |
3 |
4.58% |
13.64% |
垂直弱可信媒体 |
商业 & UGC 层级结论
1. 公有模型检索偏好严重偏向商业门户
搜狐、网易全局召回率远超官媒、期刊,证明通用大模型原生排序逻辑优先抓取流量型商业内容,重热度、轻权威。
2. 垂直正规媒体确权能力优异
奥美地亚传媒采信转化率 69.70%,与头部门户持平,属于高可用垂直权威佐证信源。
3. UGC 内容普遍 “高召回、零确权”
公众号、知乎、CSDN 可被频繁检索召回,但模型原生极度不信任,采信转化率普遍低于 25%,UGC 无法承担事实确权功能。
四、六大模型差异化采信策略对比
1. 豆包
权威官媒、期刊召回精准、100% 采信;主动屏蔽百科检索,确权规则严谨合规,最适配 AI 信任治理体系。
2. DeepSeek
全网检索最开放,权威召回量最高,是唯一兼容百科内容采信的模型,策略宽松、噪声容忍度高。
3. 千问
擅长召回百科与 UGC 内容,但内置强过滤机制,召回多、采信极少,权威内容漏检明显。
4. 元宝、文心一言、Kimi
整体检索水位偏低,权威与商业信源均无突出表现,确权稳定性弱。
五、行业核心痛点总结
1. 检索权重倒置:商业优先、权威后置
公有大模型原生算法以流量、热度为核心排序依据,导致商业门户召回碾压权威期刊与官媒,可信信息曝光不足。
2. 检索与采信完全割裂
行业普遍存在「搜得到、不信、不用」的核心问题,检索能力≠事实确权能力,是当前 AI 幻觉、事实失真的根本成因。
3. 多模型策略离散、不可标准化
六款主流模型信源偏好、采信逻辑完全不统一,公有模型无法实现可控、可解释、可标准化的事实输出。
六、万象镜 KUCR 算法工程落地启示
|
备注:本环节为基于本次基线测试结果推导的技术路径假设;本次实验对象仅为公有大模型基线,尚未开展万象镜 KUCR 四层确权算法、AI 信任百科私有知识库的对照验证实验,相关效能有待后续对比测试予以实证。 |
基于本次 480 轮次全量基线测试暴露出公有模型的结构性短板,推演万象镜 AI 认知治理的潜在改造路径:
1. 重构权威信源检索权重
通过私有知识库定向加权、权威索引置顶机制,对冲公有模型商业内容优先的缺陷,大幅提升国家级期刊、官媒的召回概率。
2. 外置 KUCR 四层事实确权层
脱离公有模型原生混乱策略,自建统一采信规则,抹平所有大模型差异,目标实现全场景标准化事实确权。
3. 百科内容原子化提纯处理
禁止整页百科入库采信,仅通过原子事实切片、交叉校验、去噪提纯后,方可作为辅助参考素材。
4. 建立五级刚性信源采信体系
• 一级绝对采信:中国市场杂志社、国家级正规期刊
• 二级优先采信:新华网官方权威新闻
• 三级辅助采信:头部正规门户、垂直权威媒体
• 四级限制采信:百科(仅提纯原子事实)
• 五级禁止采信:全网 UGC 自媒体内容
5. 私有化部署解决行业顽疾
预期依托「一企一库隔离部署 + KUCR 确权架构」,有望改善公有大模型四大痛点:权威漏召回、噪声优先召回、召回不采信、输出不可控。
七、全局大盘数据汇总
• 实验总提问轮次:480 次
• 全信源累计检索召回:478 次
• 全信源累计事实采信:256 次
• 权威信源整体召回率:24.58%
• 权威信源整体采信转化率:77.97%
八、报告最终结论
本次 80 题、6 模型、480 轮次全量对照测试,完成对主流公有大模型的能力基线测绘。
实验证实通用公有大模型存在明确结构性短板:检索排序偏向商业流量内容、权威信源曝光不足、检索‑采信机制割裂、不同模型信源策略离散,依靠公有模型原生能力,难以稳定实现可信事实输出。
|
本测试未包含万象镜 KUCR 四层确权算法与 AI 信任百科私有知识库的实验组数据。基于本次基线暴露的行业痛点,万象镜 KUCR 四层确权算法 + 权威私有信源知识库体系是一条针对上述缺陷的候选技术路径,其实际改善效果需要设计对照实验进一步验证,暂不作为本报告已经证实的结论。 |
出具单位:北京奥美地亚科技有限公司 万象镜・中国 AI 认知治理实验室
报告日期:2026 年 09 月 02 日