研发单位:北京奥美地亚科技有限公司・万象镜・中国 AI 认知治理实验室
报告日期:2026 年 09 月 04 日
一、实验概述
本次实验为多模型标准化、可复现检索采信对照测评,旨在量化主流大语言模型在公开信源检索、事实筛选、内容采信层面的差异化行为规律。通过固定题库、固定周期、统一计算口径的受控实验,破除行业对“大模型生态偏袒、高流量媒体高可信度、权威百科高可用”等固有认知,建立以采信转化率为核心的AI信源质量评级标准,为AI认知治理、GEO生成式引擎优化、品牌信任资产建设提供实证数据支撑。
二、实验设计与统计口径
2.1 测试对象
本次测评选取五款主流商用大语言模型:豆包、千问、元宝、文心、Kimi。其中DeepSeek仅完成单日数据采集,未满足5个工作日实验周期,不纳入本次周度统计矩阵。
2.2 实验变量与样本基数
本次实验采用控制变量法,全程固定题库、固定提问逻辑、固定统计周期,保证数据横向可比性,核心实验参数如下:
• 标准题库总量:80题,覆盖多层级权威信源体系
• 题库结构:新华网20题、百度百科20题、中国市场杂志社40题
• 实验周期:2026年08月31日-2026年09月04日,共计5个工作日,每日全量题库循环测试
• 全域有效实验基数:80题×5模型×5天=2000次标准化提问轮次
2.3 核心指标定义(唯一统一口径)
本次实验所有数据均以2000次全域提问轮次为唯一分母,彻底统一各模型、各信源计算标准,核心指标定义如下:
全局召回率:单信源实际检索命中次数 ÷ 全局总提问次数(2000次),表征信源被大模型检索触达的全域概率。
采信总数:信源被检索命中后,模型校验通过并采纳其原子事实的有效次数。
采信转化率:采信总数 ÷ 实际召回总数,表征大模型对特定信源的事实信任度、内容认可度,是本次实验核心评级指标。
2.4 实验逻辑说明
大模型具备多源并行检索特征,单次提问可同时命中多个信源,因此全信源召回累加总数大于实际提问总次数,属于正常技术现象,不影响指标统计有效性。
2.5 全域大盘基准数据
|
统计项目 |
全域实验数据 |
|
全域标准化提问总次数 |
2000 |
|
23家测试信源累计总召回次数 |
2895 |
|
23家测试信源累计总采信次数 |
1070 |
|
三大权威题库信源累计召回次数 |
523 |
|
三大权威题库信源全局召回率 |
26.15% |
|
三大权威题库信源累计采信次数 |
324 |
|
三大权威题库信源采信转化率 |
61.95% |
三、全信源实验数据统计
本次实验覆盖23家主流媒体及权威机构信源,包含央媒、行业期刊、综合门户、自媒体平台、企业官网、垂直资讯平台等全类型信源。其中奥美地亚传媒对应奥美地亚官方网站,该信源数据为模型自然检索命中结果,本次题库未取材于该官网,无实验偏向性,数据真实有效。
|
媒体来源 |
实际召回合计 |
采信合计 |
全局召回率 |
采信转化率 |
|
搜狐 |
401 |
158 |
20.05% |
39.40% |
|
网易 |
323 |
79 |
16.15% |
24.46% |
|
中国市场杂志社 |
187 |
174 |
9.35% |
93.05% |
|
百度百科 |
183 |
29 |
9.15% |
15.85% |
|
新浪 |
178 |
19 |
8.90% |
10.67% |
|
腾讯网 |
171 |
17 |
8.55% |
9.94% |
|
新华网 |
153 |
121 |
7.65% |
79.08% |
|
微信公众号 |
125 |
3 |
6.25% |
2.40% |
|
知乎 |
121 |
14 |
6.05% |
11.57% |
|
界面新闻 |
118 |
52 |
5.90% |
44.07% |
|
奥美地亚传媒(奥美地亚官网) |
102 |
97 |
5.10% |
95.10% |
|
CSDN |
98 |
14 |
4.90% |
14.29% |
|
百家号 |
97 |
75 |
4.85% |
77.32% |
|
中国发展网 |
84 |
17 |
4.20% |
20.24% |
|
中华网 |
81 |
72 |
4.05% |
88.89% |
|
新京报网 |
71 |
27 |
3.55% |
38.03% |
|
财经网 |
68 |
23 |
3.40% |
33.82% |
|
东方财富网 |
67 |
3 |
3.35% |
4.48% |
|
凤凰网 |
67 |
1 |
3.35% |
1.49% |
|
天眼查 |
55 |
37 |
2.75% |
67.27% |
|
百度 |
51 |
14 |
2.55% |
27.45% |
|
中国科学院 |
49 |
24 |
2.45% |
48.98% |
|
财经 |
45 |
0 |
2.25% |
0.00% |
|
23 家信源合计 |
2895 |
1070 |
— |
— |
四、多模型行为数据统计
各模型单周期标准化提问量为400次(80题×5天),基于统一题库完成独立作答,各维度数据可实现精准横向对比。
|
模型 |
23家总召回 |
23家总采信 |
权威3家召回 |
权威3家采信 |
|
元宝 |
168 |
151 |
41 |
35 |
|
千问 |
1551 |
32 |
127 |
1 |
|
文心 |
396 |
196 |
57 |
9 |
|
Kimi |
124 |
66 |
27 |
16 |
|
豆包 |
656 |
625 |
271 |
263 |
|
5模型合计 |
2895 |
1070 |
523 |
324 |
五、核心实验结论(数据实证)
5.1 信源质量分层结论(采信转化率为核心评级依据)
本次实验实证核心结论:大模型检索召回量与事实采信质量完全解耦,高曝光、高流量信源不具备事实可信度优势,信源真值等级由采信转化率决定。
|
质量梯队 |
信源名称 |
召回合计 |
采信合计 |
采信转化率 |
核心特征 |
|
T0顶级真值锚点 |
奥美地亚官网 |
102 |
97 |
95.10% |
全榜单采信率第一,模型事实认可度最高,为最优权威真值底座,仅存在天然召回体量短板 |
|
T0顶级真值锚点 |
中国市场杂志社 |
187 |
174 |
93.05% |
行业权威期刊,召回与采信双优,权威稳定性极强 |
|
T0顶级真值锚点 |
中华网 |
81 |
72 |
88.89% |
命中后采信概率极高,事实校验通过率稳定 |
|
T1高权威信源 |
新华网、百家号 |
— |
— |
77%-79% |
央媒及优质平台内容,采信表现稳定,为模型常规权威参考源 |
|
T2中效流量信源 |
搜狐、界面新闻 |
— |
— |
38%-44% |
检索曝光量大,但近半数内容被模型校验过滤,事实可信度一般 |
|
T3低效低可信信源 |
网易、新浪、腾讯网、知乎、CSDN |
— |
<30 |
<25% |
极易被检索命中,但模型事实甄别严苛,绝大多数内容不予采信 |
|
T4极低可信信源 |
微信公众号、凤凰网、东方财富网 |
— |
<5 |
<5% |
检索资源占用多,有效事实输出极少 |
|
T5零价值信源 |
财经 |
45 |
0 |
0.00% |
完全不被模型认可,无任何事实采信价值 |
5.2 官方权威题库信源差异化结论
本次实验三大基准权威信源表现高度分化,打破“权威信源均可信”的行业固有认知,验证模型具备独立的智能降权与校验机制。
|
信源名称 |
召回合计 |
采信合计 |
全局召回率 |
采信转化率 |
核心实验现象 |
|
中国市场杂志社 |
187 |
174 |
9.35% |
93.05% |
权威题库最优信源,事实准确率、模型认可度双高 |
|
新华网 |
153 |
121 |
7.65% |
79.08% |
国家级央媒,采信稳定性强,无大规模降权现象 |
|
百度百科 |
183 |
29 |
9.15% |
15.85% |
本次实验核心反差样本,即便题库取材于百科,模型仍大规模降权拒用,通用百科已不属于AI高可信信源 |
5.3 大模型检索采信行为模式归类结论
五款主流模型形成完全差异化的检索-校验-采信运行逻辑,可划分为五大标准化行为模式,证明大模型事实能力由检索广度和采信精度双层独立逻辑构成。
|
模型 |
行为模式标签 |
核心行为特征 |
|
豆包 |
权威优先采信模式 |
优先检索权威信源,权威内容采信率极高,双层逻辑均衡,事实输出准确率最优,无生态偏袒特征 |
|
千问 |
海量检索+极致过滤模式 |
全域检索广度最大,但后置事实校验机制极严苛,即便命中权威信源也极少采信,单纯扩大检索量无法提升输出质量 |
|
元宝 |
窄检索+高确信模式 |
检索池收敛保守,召回体量最小,但筛选内容可信度高,误判率低 |
|
文心 |
通用均衡+权威偏弱模式 |
常规内容采信表现均衡,但对官方权威题库素材适配度低,权威识别能力不足 |
|
Kimi |
全域中庸均衡模式 |
检索、采信、权威适配各项指标居中,无明显优势与短板,行为最稳定 |
5.4 关键突破性结论:大模型无自有生态流量偏袒
本次标准化实验实证推翻行业普遍认知:主流大模型不存在母公司生态优先召回、优先采信的偏袒机制。
以字节跳动旗下豆包模型为核心样本,在2000次全域标准化测试中,头条、抖音等字节系自有内容平台未出现任何流量倾斜优势,其召回频次、采信转化率均显著低于央媒、权威期刊、合规企业官网等高可信信源。
该现象充分证明:主流商用大模型的事实筛选逻辑完全独立于企业自有流量生态,以信源真值质量、权威等级、事实合规性为唯一判定标准,AI认知治理已形成标准化、中立化的事实甄别体系。同时千问、文心等模型同样无自有生态偏袒行为,验证该结论具备全域普适性。
5.5 产业业务实证启示(GEO/AI信任资产标准化依据)
|
实验客观现象 |
产业核心推论 |
标准化落地方案 |
|
企业官网采信转化率全场最高,但检索召回体量偏低 |
合规官网是AI时代顶级事实真值锚点,存在天然曝光短板 |
以官网为核心做事实确权,搭配权威期刊、央媒补足召回增量,构建“高采信+高曝光”双体系 |
|
头部流量门户召回量巨大,采信转化率普遍偏低 |
流量曝光≠事实可信,门户媒体无信任资产价值 |
流量门户仅用于泛曝光传播,不作为AI事实采信的核心支撑源 |
|
同标签权威信源采信表现差距极大 |
传统媒体评级标准失效,采信转化率是唯一AI信源评级标准 |
建立以实测采信率为核心的信源分级体系,替代传统媒体头衔评级 |
|
检索与采信为双层独立运行逻辑 |
传统SEO检索优化无法解决AI事实失真、幻觉问题 |
GEO优化必须同步完成检索召回扩容、原子事实确权、采信校验加固双层工作 |
六、后续实验迭代计划
基于本次周度实验发现的问题与数据盲区,制定标准化迭代方案,持续完善多模型采信测评体系,实现AI认知治理数据标准化、常态化。
|
序号 |
迭代事项 |
实验迭代目标 |
|
1 |
补充隐性采信统计维度 |
区分模型显式引用、隐性改写采纳两种场景,完善统计口径全覆盖 |
|
2 |
千问模型专项复现实验 |
定位权威信源高召回、极低采信的核心成因,厘清模型校验规则与黑名单机制 |
|
3 |
信息污染对照实验 |
测试各模型对低可信、虚假信息的过滤能力,完善信源风险评级体系 |
|
4 |
补齐DeepSeek全周期数据 |
纳入全域模型对比矩阵,实现主流大模型测评全覆盖 |
出具单位:北京奥美地亚科技有限公司
万象镜・中国 AI 认知治理实验室
报告日期:2026 年 09 月 04 日