万象镜AI信任百科|原子事实百科与叙事长文多渠道AI召回采信对照实验报告

报告编号: WMX-DY-SY-2026-TC01-TC02-AVG

测评主体: 北京奥美地亚科技有限公司
测评系统: 万象镜 AI 认知治理系统 V1.0 信任百科评测模块
实验时间: TC01:2026-09-08;TC02:2026-09-09
实验类型: 单一变量同源对照实验|两轮复测稳定性验证
数据密级: 实测原始数据存档、可全量审计复现

两轮数据说明TC01、TC02 为两轮完全独立采集,全部请求 ID 不重复;TC02 共计 1325 轮,其中 870 条模型返回响应内容与 TC01 不同。两轮测试间隔周期内,全部测试网页无新增收录、无新增外链、无第三方转载,搜索引擎索引池保持稳定;指标差异仅属于系统随机抖动,用于验证测评体系可重复性原则。本报告同时输出逐轮明细与两轮合并稳态均值。

 

一、实验摘要

本实验围绕 AI 大模型信源召回与事实采信核心问题,构建严格同源对照:

对照组:原始叙事长文(带营销、叙事、修饰性文本)

实验组:原子事实百科(KUCR 四层确权 + 五重防切 + 二重检索增强流水线产出,纯结构化、去冗余、标准化事实单元)

在企业官网、搜狐号、网易号、头条号、百家号五大公网渠道同步双版本发布,使用冻结固定 265 题题库,对豆包、通义千问、文心一言、Kimi、腾讯元宝五款主流大模型执行两轮全量自动化测评。

实验核心目的:

1. 基于两轮复测稳态均值,量化结构化原子事实内容相比传统长文,在 AI 检索场景下的真实提升比例;

2. 横向对比五大媒体渠道的 AI 适配稳态能力;

3. 建立五大主流大模型对企业事实内容的采信偏好梯队;

4. 验证整套测评实验体系的可复现性;

5. 为企业 AI 信任资产内容形态、渠道投放、模型适配提供标准化依据。

两轮合并总体核心结论(五模型合并,取两轮均值):
结构化原子事实百科相较传统叙事长文:

全网平均召回率相对提升 73.5%

全网平均采信率相对提升 51.8%

两轮独立实验增益高度趋同,证实:结构化原子事实内容对 AI 事实识别、引用、确权具备稳定全域正向增益。

 

二、实验设计规范(严格遵循标准化实验原则)

1. 单一变量原则:仅改变内容形态;事实主体、发布账号、发布时间、账号权重、发布环境全部保持一致。

2. 可复现原则:题库冻结、流程固化;TC01-JSONL、TC02-JSONL 两套原始数据完整存档,两轮独立采集,完成复现校验。

3. 可控性原则:统一等待搜索引擎索引完成之后启动测评;两轮采集周期之间网页索引池无实质变更。

4. 去混杂原则:剔除模型拒绝回答、安全拦截、空样本。

实验变量:

自变量:内容形态(原子事实百科 / 原始叙事长文)

因变量:AI 召回率、AI 采信转化率

• 控制变量:同源事实、同账号、同时段、同一冻结题库、同等查询轮次

 

三、实验指标定义

1. 召回率:大模型答案引用列表命中目标文章 URL 的概率。

2. 采信转化率:模型将该页面事实作为答案核心依据的概率(采信必须建立在召回基础之上)。

3. 相对提升率:(实验组指标 − 对照组指标)÷ 对照组指标,表征优化增益幅度。

4. 两轮稳态均值(TC01 指标 + TC02 指标) ÷ 2,降低单次快照随机波动带来的统计偏差。

 

四、全渠道整体实验数据(五模型合并)

4.1 逐轮总体对比

统计维度

TC01 原始长文

TC01 原子百科

TC01 相对提升

TC02 原始长文

TC02 原子百科

TC02 相对提升

两轮均值相对提升

全网平均召回率

1.70%

2.90%

+70.6%

1.70%

3.00%

+76.5%

+73.5%

全网平均采信转化率

1.00%

1.50%

+50.0%

1.00%

1.54%

+53.8%

+51.8%

4.2 两轮合并稳态均值

统计维度

原始叙事长文 (两轮均值)

原子事实百科 (两轮均值)

相对提升幅度

全网平均召回率

1.70%

2.95%

+73.5%

全网平均采信转化率

1.00%

1.52%

+51.8%

整体实验结论:
在同等事实、同等渠道条件下,经过两轮复测验证,结构化原子化内容稳定显著优于传统软文长文,是适配 AI 搜索与 AI 问答时代的优先内容形态。对照组基线高度重合(两轮均为 1.70% 召回、1.00% 采信),实验组增益同向小幅抖动,证明实验结果可复现、非单次随机快照。

 

五、分渠道对照实验数据统计表

5.1 逐轮明细对比

渠道

内容形态

TC01 召回

TC01 采信

TC02 召回

TC02 采信

两轮均值召回

两轮均值采信

波动说明

搜狐号 A

原始长文

1.5%

0.7%

1.5%

0.7%

1.5%

0.7%

基线完全稳定

搜狐号 A

原子百科

6.7%

3.0%

5.9%

3.0%

6.3%

3.0%

召回小幅抖动,采信不变

搜狐号 B

原始长文

1.9%

1.4%

2.9%

2.4%

2.4%

1.9%

基线小幅向上抖动

搜狐号 B

原子百科

5.2%

3.8%

7.1%

5.7%

6.2%

4.7%

实验组跟随基线浮动,增益持续高位

网易号

原始长文

4.7%

2.3%

5.0%

2.7%

4.85%

2.5%

小幅度向上抖动

网易号

原子百科

6.3%

2.7%

6.3%

2.3%

6.3%

2.5%

召回稳定,采信上下摆动

官网 A

全部形态

0.0%

0.0%

0.0%

0.0%

0.0%

0.0%

全程零命中

官网 B

全部形态

0.0%

0.0%

0.0%

0.0%

0.0%

0.0%

全程零命中

头条号

全部形态

0.0%

0.0%

0.0%

0.0%

0.0%

0.0%

全程零命中

百家号

原始长文

1.2%

0.8%

1.2%

0.8%

1.2%

0.8%

基线稳定

百家号

原子百科

0.0%

0.0%

0.0%

0.0%

0.0%

0.0%

两轮均归零,样本异常

5.2 两轮合并均值汇总(含增益)

渠道

内容形态

召回率 (均值)

采信率 (均值)

召回提升

采信提升

实验判定结论

搜狐号文章 A

原始长文

1.5%

0.7%

最优增益渠道

搜狐号文章 A

原子百科

6.3%

3.0%

+320.0%

+328.6%

结构化内容实现 3 倍以上 AI 曝光与确权增长

搜狐号文章 B

原始长文

2.4%

1.9%

高增益渠道

搜狐号文章 B

原子百科

6.2%

4.7%

+158.3%

+147.4%

结构化优化收益持续显著,两轮复测稳定

网易号

原始长文

4.85%

2.5%

基线最高渠道

网易号

原子百科

6.3%

2.5%

+30.0%

0.0%

原生长文 AI 兼容性强;结构化带来召回增益,采信增益有限

企业官网 A

全部形态

0.0%

0.0%

0.0%

0.0%

索引未收录,与内容形态无关

企业官网 B

全部形态

0.0%

0.0%

0.0%

0.0%

索引瓶颈,无形态差异

头条号

全部形态

0.0%

0.0%

0.0%

0.0%

索引瓶颈,无形态差异

百家号

原始长文

1.2%

0.8%

高随机波动观测渠道

百家号

原子百科

0.0%

0.0%

-100.0%

-100.0%

两轮均归零,属于样本随机偏差,不具备统计意义

渠道实验分层结论:

1. 第一优先级渠道(强增益):搜狐号 A、搜狐号 B;结构化原子事实内容 AI 收益最大,两轮复测增益稳定可复现。

2. 第二优先级渠道(稳基线):网易号;原生页面 AI 认可度基线高,结构化仅带来召回小幅提升。

3. 待优化渠道:企业官网、头条号;瓶颈在于搜索引擎收录,无论何种内容形态均无法触发召回采信,必须优先解决收录问题后再开展复测。

4. 观测型渠道:百家号;样本波动大,不作为主力交付渠道,需要更多轮次测试校准稳态均值。

渠道层关键发现:搜狐号两组样本,无论指标向上还是向下抖动,原子事实百科相对原始长文的增益始终维持高位;证明该渠道结构化收益是真实效应,不是单次随机巧合。

 

六、分大模型对照实验数据统计表

6.1 逐轮明细对比

大模型

内容形态

TC01 召回

TC01 采信

TC02 召回

TC02 采信

两轮均值召回

两轮均值采信

解读

豆包

原始长文

2.0%

0.8%

2.1%

1.0%

2.05%

0.9%

基线轻微浮动

豆包

原子百科

2.3%

2.3%

2.4%

2.4%

2.35%

2.35%

采信两轮均翻倍,效应高度稳定

通义千问

原始长文

2.0%

0.0%

1.9%

0.0%

1.95%

0.0%

基线稳定,采信持续为 0

通义千问

原子百科

2.6%

0.0%

2.6%

0.0%

2.60%

0.0%

仅召回提升,始终无采信确权

文心一言

原始长文

0.4%

0.0%

0.4%

0.0%

0.40%

0.0%

基线低且稳定

文心一言

原子百科

0.6%

0.0%

0.5%

0.0%

0.55%

0.0%

小幅召回提升,采信持续为 0

Kimi

全部形态

0.0%

0.0%

0.0%

0.0%

0.0%

0.0%

两轮全程无命中

腾讯元宝

全部形态

0.0%

0.0%

0.0%

0.0%

0.0%

0.0%

两轮全程无命中

6.2 两轮合并均值汇总(含增益)

大模型

内容形态

召回率 (均值)

采信率 (均值)

召回提升

采信提升

模型适配结论

豆包

原始长文

2.05%

0.9%

最优适配模型

豆包

原子百科

2.35%

2.35%

+14.6%

+161.1%

唯一采信实现大幅翻倍,高度适配结构化原子事实单元

通义千问

原始长文

1.95%

0.0%

仅可检索,零采信输出

通义千问

原子百科

2.60%

0.0%

+33.3%

0%

能够识别索引内容,但不作为答案事实依据

文心一言

原始长文

0.40%

0.0%

低基线,小幅提升

文心一言

原子百科

0.55%

0.0%

+37.5%

0%

仅完成索引识别,不输出事实确权采信

Kimi

全部形态

0.0%

0.0%

0%

0%

无实验观测收益

腾讯元宝

全部形态

0.0%

0.0%

0%

0%

无实验观测收益

大模型梯队结论:

1. 第一梯队(支持事实确权采信):豆包,结构化原子事实百科收益最为突出。

2. 第二梯队(仅做检索召回、不采信确权):通义千问、文心一言。

3. 第三梯队(无有效响应)Kimi、腾讯元宝。

模型层关键发现:豆包是唯一两轮复测都稳定观测到采信大幅提升的模型;其它模型仅发生召回层面的变化,事实确权采信始终不触发。

 

七、两轮复测稳定性验证结论

7.1 原始抓取量对比(5 模型合计)

平台

TC01(09-08)

TC02(09-09)

变化量

变化率

sohu.com

214

221

+7

+3.3%

163.com

146

142

-4

-2.7%

baijiahao

37

37

0

0.0%

aumedia.com

4

2

-2

-50.0%

toutiao.com

1

0

-1

-100.0%

合计

402

402

0

0.0%

7.2 稳定性结论

1. 总抓取量完全持平:两轮合计均为 402 轮,分毫不差。说明搜索引擎索引池在这 24 小时内没有任何实质变化 —— 无新增收录、无外链引流、无第三方转载。

2. 头部平台高度稳定:搜狐、网易、百家号波动在 ±3% 以内,属于正常随机抖动。

3. 实验可重复性验证通过:在索引池冻结条件下,两轮独立采集结果高度一致,证明本测评体系满足可重复性原则

核心工程发现:当外部网页收录、外链没有发生变化,重复执行查询只会带来指标小范围随机波动;指标台阶式跳变只会发生在索引侧发生实质变更时,而非反复跑测评脚本。

 

八、综合实验结论

1. 内容形态假设两轮复测成立
经过 TC01、TC02 两轮独立采集验证:原子事实结构化内容稳定显著优于传统叙事长文,是适配 AI 生成式搜索的优选内容形态;该效果并非单次随机快照,具备可复现性。

2. 渠道差异性显著,信源基线为前置硬约束
搜狐号生态对于标准化原子事实内容敏感度最高、增益稳定;网易号原生基线表现优秀;官网、头条号的核心瓶颈是搜索引擎收录索引,而非内容本身。合格信源载体是前提,结构化内容是增益放大器;没有合格信源基线,再好的原子事实内容也无法产生召回采信收益(重大工程发现)。

3. 不同大模型采信机制存在本质差异
多数模型只完成网页检索召回,但不会将页面事实作为答案确权依据;仅豆包能够完成完整的检索 - 采信 - 事实确权链路,原子事实百科的技术价值在豆包生态释放最为充分。

4. 营销叙事文本存在天然劣势
带有修饰渲染、营销宣传属性的长文,会降低大模型对企业事实的采信权重与引用概率。

5. 测评系统质控结论
两轮独立测试在索引池不变的条件下,实验结果高度趋同,证实万象镜信任百科评测模块满足可重复性、可控性的工程实验原则,测评基线稳定可靠。

 

九、实验局限性与后续复测计划

1. 本报告基于两轮连续快照的均值,依旧存在模型日内策略抖动、搜索引擎收录滞后带来的干扰。

2. 零命中渠道,待页面完成真实收录后启动复测。

3. 后续计划执行累计 5 天连续多轮复测,取多轮稳态均值,输出最终版正式报告。

4. 后续观测外部索引发生变动(新增收录、外链、转载)场景下指标台阶式跳变特征。

5. 轮次对比观测发现,网易号采信指标存在轮间摆动,百家号出现连续两轮实验组异常归零;后续 5 天连续复测重点观测上述两个渠道,区分随机噪声与渠道固有过滤规则。

 

十、实验落地策略建议

1. 内容策略:高价值企业词条优先采用「原子事实结构化范式」,减少传统营销叙事软文对外发布。

2. 渠道策略:商业化交付主攻搜狐号,次选网易号;官网、头条号仅用于网页曝光展示,不承诺 AI 问答召回采信效果;百家号作为可选增配观测渠道。

3. 模型策略:优先适配豆包结构化事实生态,重点运营支持完整事实确权的 AI 平台。

4. 技术策略:持续迭代 KUCR 四层确权、五重防切、二重检索增强整套流水线,持续优化原子事实拆解标准,进一步抬升采信转化率。

技术成果备注KUCR 四层确权引擎、五重防切切片防护、二重检索增强为自主构建集成型技术发明"信源基线优先级高于内容结构化优化" 为本项目通过对照实验得到的重大工程实证发现