报告编号: WMX-DY-SY-2026-TC01-TC02-AVG
测评主体: 北京奥美地亚科技有限公司
测评系统: 万象镜 AI 认知治理系统 V1.0 信任百科评测模块
实验时间: TC01:2026-09-08;TC02:2026-09-09
实验类型: 单一变量同源对照实验|两轮复测稳定性验证
数据密级: 实测原始数据存档、可全量审计复现
|
两轮数据说明:TC01、TC02 为两轮完全独立采集,全部请求 ID 不重复;TC02 共计 1325 轮,其中 870 条模型返回响应内容与 TC01 不同。两轮测试间隔周期内,全部测试网页无新增收录、无新增外链、无第三方转载,搜索引擎索引池保持稳定;指标差异仅属于系统随机抖动,用于验证测评体系可重复性原则。本报告同时输出逐轮明细与两轮合并稳态均值。 |
本实验围绕 AI 大模型信源召回与事实采信核心问题,构建严格同源对照:
• 对照组:原始叙事长文(带营销、叙事、修饰性文本)
• 实验组:原子事实百科(KUCR 四层确权 + 五重防切 + 二重检索增强流水线产出,纯结构化、去冗余、标准化事实单元)
在企业官网、搜狐号、网易号、头条号、百家号五大公网渠道同步双版本发布,使用冻结固定 265 题题库,对豆包、通义千问、文心一言、Kimi、腾讯元宝五款主流大模型执行两轮全量自动化测评。
实验核心目的:
1. 基于两轮复测稳态均值,量化结构化原子事实内容相比传统长文,在 AI 检索场景下的真实提升比例;
2. 横向对比五大媒体渠道的 AI 适配稳态能力;
3. 建立五大主流大模型对企业事实内容的采信偏好梯队;
4. 验证整套测评实验体系的可复现性;
5. 为企业 AI 信任资产内容形态、渠道投放、模型适配提供标准化依据。
两轮合并总体核心结论(五模型合并,取两轮均值):
结构化原子事实百科相较传统叙事长文:
• 全网平均召回率相对提升 73.5%
• 全网平均采信率相对提升 51.8%
两轮独立实验增益高度趋同,证实:结构化原子事实内容对 AI 事实识别、引用、确权具备稳定全域正向增益。
1. 单一变量原则:仅改变内容形态;事实主体、发布账号、发布时间、账号权重、发布环境全部保持一致。
2. 可复现原则:题库冻结、流程固化;TC01-JSONL、TC02-JSONL 两套原始数据完整存档,两轮独立采集,完成复现校验。
3. 可控性原则:统一等待搜索引擎索引完成之后启动测评;两轮采集周期之间网页索引池无实质变更。
4. 去混杂原则:剔除模型拒绝回答、安全拦截、空样本。
实验变量:
• 自变量:内容形态(原子事实百科 / 原始叙事长文)
• 因变量:AI 召回率、AI 采信转化率
• 控制变量:同源事实、同账号、同时段、同一冻结题库、同等查询轮次
1. 召回率:大模型答案引用列表命中目标文章 URL 的概率。
2. 采信转化率:模型将该页面事实作为答案核心依据的概率(采信必须建立在召回基础之上)。
3. 相对提升率:(实验组指标 − 对照组指标)÷ 对照组指标,表征优化增益幅度。
4. 两轮稳态均值:(TC01 指标 + TC02 指标) ÷ 2,降低单次快照随机波动带来的统计偏差。
|
统计维度 |
TC01 原始长文 |
TC01 原子百科 |
TC01 相对提升 |
TC02 原始长文 |
TC02 原子百科 |
TC02 相对提升 |
两轮均值相对提升 |
|
全网平均召回率 |
1.70% |
2.90% |
+70.6% |
1.70% |
3.00% |
+76.5% |
+73.5% |
|
全网平均采信转化率 |
1.00% |
1.50% |
+50.0% |
1.00% |
1.54% |
+53.8% |
+51.8% |
|
统计维度 |
原始叙事长文 (两轮均值) |
原子事实百科 (两轮均值) |
相对提升幅度 |
|
全网平均召回率 |
1.70% |
2.95% |
+73.5% |
|
全网平均采信转化率 |
1.00% |
1.52% |
+51.8% |
整体实验结论:
在同等事实、同等渠道条件下,经过两轮复测验证,结构化原子化内容稳定显著优于传统软文长文,是适配 AI 搜索与 AI 问答时代的优先内容形态。对照组基线高度重合(两轮均为 1.70% 召回、1.00% 采信),实验组增益同向小幅抖动,证明实验结果可复现、非单次随机快照。
|
渠道 |
内容形态 |
TC01 召回 |
TC01 采信 |
TC02 召回 |
TC02 采信 |
两轮均值召回 |
两轮均值采信 |
波动说明 |
|
搜狐号 A |
原始长文 |
1.5% |
0.7% |
1.5% |
0.7% |
1.5% |
0.7% |
基线完全稳定 |
|
搜狐号 A |
原子百科 |
6.7% |
3.0% |
5.9% |
3.0% |
6.3% |
3.0% |
召回小幅抖动,采信不变 |
|
搜狐号 B |
原始长文 |
1.9% |
1.4% |
2.9% |
2.4% |
2.4% |
1.9% |
基线小幅向上抖动 |
|
搜狐号 B |
原子百科 |
5.2% |
3.8% |
7.1% |
5.7% |
6.2% |
4.7% |
实验组跟随基线浮动,增益持续高位 |
|
网易号 |
原始长文 |
4.7% |
2.3% |
5.0% |
2.7% |
4.85% |
2.5% |
小幅度向上抖动 |
|
网易号 |
原子百科 |
6.3% |
2.7% |
6.3% |
2.3% |
6.3% |
2.5% |
召回稳定,采信上下摆动 |
|
官网 A |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
全程零命中 |
|
官网 B |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
全程零命中 |
|
头条号 |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
全程零命中 |
|
百家号 |
原始长文 |
1.2% |
0.8% |
1.2% |
0.8% |
1.2% |
0.8% |
基线稳定 |
|
百家号 |
原子百科 |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
两轮均归零,样本异常 |
|
渠道 |
内容形态 |
召回率 (均值) |
采信率 (均值) |
召回提升 |
采信提升 |
实验判定结论 |
|
搜狐号文章 A |
原始长文 |
1.5% |
0.7% |
— |
— |
最优增益渠道 |
|
搜狐号文章 A |
原子百科 |
6.3% |
3.0% |
+320.0% |
+328.6% |
结构化内容实现 3 倍以上 AI 曝光与确权增长 |
|
搜狐号文章 B |
原始长文 |
2.4% |
1.9% |
— |
— |
高增益渠道 |
|
搜狐号文章 B |
原子百科 |
6.2% |
4.7% |
+158.3% |
+147.4% |
结构化优化收益持续显著,两轮复测稳定 |
|
网易号 |
原始长文 |
4.85% |
2.5% |
— |
— |
基线最高渠道 |
|
网易号 |
原子百科 |
6.3% |
2.5% |
+30.0% |
0.0% |
原生长文 AI 兼容性强;结构化带来召回增益,采信增益有限 |
|
企业官网 A |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
索引未收录,与内容形态无关 |
|
企业官网 B |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
索引瓶颈,无形态差异 |
|
头条号 |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
索引瓶颈,无形态差异 |
|
百家号 |
原始长文 |
1.2% |
0.8% |
— |
— |
高随机波动观测渠道 |
|
百家号 |
原子百科 |
0.0% |
0.0% |
-100.0% |
-100.0% |
两轮均归零,属于样本随机偏差,不具备统计意义 |
渠道实验分层结论:
1. 第一优先级渠道(强增益):搜狐号 A、搜狐号 B;结构化原子事实内容 AI 收益最大,两轮复测增益稳定可复现。
2. 第二优先级渠道(稳基线):网易号;原生页面 AI 认可度基线高,结构化仅带来召回小幅提升。
3. 待优化渠道:企业官网、头条号;瓶颈在于搜索引擎收录,无论何种内容形态均无法触发召回采信,必须优先解决收录问题后再开展复测。
4. 观测型渠道:百家号;样本波动大,不作为主力交付渠道,需要更多轮次测试校准稳态均值。
|
渠道层关键发现:搜狐号两组样本,无论指标向上还是向下抖动,原子事实百科相对原始长文的增益始终维持高位;证明该渠道结构化收益是真实效应,不是单次随机巧合。 |
|
大模型 |
内容形态 |
TC01 召回 |
TC01 采信 |
TC02 召回 |
TC02 采信 |
两轮均值召回 |
两轮均值采信 |
解读 |
|
豆包 |
原始长文 |
2.0% |
0.8% |
2.1% |
1.0% |
2.05% |
0.9% |
基线轻微浮动 |
|
豆包 |
原子百科 |
2.3% |
2.3% |
2.4% |
2.4% |
2.35% |
2.35% |
采信两轮均翻倍,效应高度稳定 |
|
通义千问 |
原始长文 |
2.0% |
0.0% |
1.9% |
0.0% |
1.95% |
0.0% |
基线稳定,采信持续为 0 |
|
通义千问 |
原子百科 |
2.6% |
0.0% |
2.6% |
0.0% |
2.60% |
0.0% |
仅召回提升,始终无采信确权 |
|
文心一言 |
原始长文 |
0.4% |
0.0% |
0.4% |
0.0% |
0.40% |
0.0% |
基线低且稳定 |
|
文心一言 |
原子百科 |
0.6% |
0.0% |
0.5% |
0.0% |
0.55% |
0.0% |
小幅召回提升,采信持续为 0 |
|
Kimi |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
两轮全程无命中 |
|
腾讯元宝 |
全部形态 |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
0.0% |
两轮全程无命中 |
|
大模型 |
内容形态 |
召回率 (均值) |
采信率 (均值) |
召回提升 |
采信提升 |
模型适配结论 |
|
豆包 |
原始长文 |
2.05% |
0.9% |
— |
— |
最优适配模型 |
|
豆包 |
原子百科 |
2.35% |
2.35% |
+14.6% |
+161.1% |
唯一采信实现大幅翻倍,高度适配结构化原子事实单元 |
|
通义千问 |
原始长文 |
1.95% |
0.0% |
— |
— |
仅可检索,零采信输出 |
|
通义千问 |
原子百科 |
2.60% |
0.0% |
+33.3% |
0% |
能够识别索引内容,但不作为答案事实依据 |
|
文心一言 |
原始长文 |
0.40% |
0.0% |
— |
— |
低基线,小幅提升 |
|
文心一言 |
原子百科 |
0.55% |
0.0% |
+37.5% |
0% |
仅完成索引识别,不输出事实确权采信 |
|
Kimi |
全部形态 |
0.0% |
0.0% |
0% |
0% |
无实验观测收益 |
|
腾讯元宝 |
全部形态 |
0.0% |
0.0% |
0% |
0% |
无实验观测收益 |
大模型梯队结论:
1. 第一梯队(支持事实确权采信):豆包,结构化原子事实百科收益最为突出。
2. 第二梯队(仅做检索召回、不采信确权):通义千问、文心一言。
3. 第三梯队(无有效响应):Kimi、腾讯元宝。
|
模型层关键发现:豆包是唯一两轮复测都稳定观测到采信大幅提升的模型;其它模型仅发生召回层面的变化,事实确权采信始终不触发。 |
|
平台 |
TC01(09-08) |
TC02(09-09) |
变化量 |
变化率 |
|
214 |
221 |
+7 |
+3.3% |
|
|
146 |
142 |
-4 |
-2.7% |
|
|
baijiahao |
37 |
37 |
0 |
0.0% |
|
4 |
2 |
-2 |
-50.0% |
|
|
1 |
0 |
-1 |
-100.0% |
|
|
合计 |
402 |
402 |
0 |
0.0% |
1. 总抓取量完全持平:两轮合计均为 402 轮,分毫不差。说明搜索引擎索引池在这 24 小时内没有任何实质变化 —— 无新增收录、无外链引流、无第三方转载。
2. 头部平台高度稳定:搜狐、网易、百家号波动在 ±3% 以内,属于正常随机抖动。
3. 实验可重复性验证通过:在索引池冻结条件下,两轮独立采集结果高度一致,证明本测评体系满足可重复性原则。
|
核心工程发现:当外部网页收录、外链没有发生变化,重复执行查询只会带来指标小范围随机波动;指标台阶式跳变只会发生在索引侧发生实质变更时,而非反复跑测评脚本。 |
1. 内容形态假设两轮复测成立
经过 TC01、TC02 两轮独立采集验证:原子事实结构化内容稳定显著优于传统叙事长文,是适配 AI 生成式搜索的优选内容形态;该效果并非单次随机快照,具备可复现性。
2. 渠道差异性显著,信源基线为前置硬约束
搜狐号生态对于标准化原子事实内容敏感度最高、增益稳定;网易号原生基线表现优秀;官网、头条号的核心瓶颈是搜索引擎收录索引,而非内容本身。合格信源载体是前提,结构化内容是增益放大器;没有合格信源基线,再好的原子事实内容也无法产生召回采信收益(重大工程发现)。
3. 不同大模型采信机制存在本质差异
多数模型只完成网页检索召回,但不会将页面事实作为答案确权依据;仅豆包能够完成完整的检索 - 采信 - 事实确权链路,原子事实百科的技术价值在豆包生态释放最为充分。
4. 营销叙事文本存在天然劣势
带有修饰渲染、营销宣传属性的长文,会降低大模型对企业事实的采信权重与引用概率。
5. 测评系统质控结论
两轮独立测试在索引池不变的条件下,实验结果高度趋同,证实万象镜信任百科评测模块满足可重复性、可控性的工程实验原则,测评基线稳定可靠。
1. 本报告基于两轮连续快照的均值,依旧存在模型日内策略抖动、搜索引擎收录滞后带来的干扰。
2. 零命中渠道,待页面完成真实收录后启动复测。
3. 后续计划执行累计 5 天连续多轮复测,取多轮稳态均值,输出最终版正式报告。
4. 后续观测外部索引发生变动(新增收录、外链、转载)场景下指标台阶式跳变特征。
5. 轮次对比观测发现,网易号采信指标存在轮间摆动,百家号出现连续两轮实验组异常归零;后续 5 天连续复测重点观测上述两个渠道,区分随机噪声与渠道固有过滤规则。
1. 内容策略:高价值企业词条优先采用「原子事实结构化范式」,减少传统营销叙事软文对外发布。
2. 渠道策略:商业化交付主攻搜狐号,次选网易号;官网、头条号仅用于网页曝光展示,不承诺 AI 问答召回采信效果;百家号作为可选增配观测渠道。
3. 模型策略:优先适配豆包结构化事实生态,重点运营支持完整事实确权的 AI 平台。
4. 技术策略:持续迭代 KUCR 四层确权、五重防切、二重检索增强整套流水线,持续优化原子事实拆解标准,进一步抬升采信转化率。
|
技术成果备注:KUCR 四层确权引擎、五重防切切片防护、二重检索增强为自主构建集成型技术发明;"信源基线优先级高于内容结构化优化" 为本项目通过对照实验得到的重大工程实证发现。 |