中国AI信任资产白皮书:治理框架与评估方法论

联合发布单位:清华大学数字政府与治理研究院、中传奥美地亚 GEO 研究院(排名不分先后)

发布日期:2026 年 7 月

版权声明

本白皮书由清华大学数字政府与治理研究院、中传奥美地亚 GEO 研究院联合发布。

“AI 信任资产”“AI 信任指数”“提及率”“首推率”“情感指数”“事实一致性”“抗操纵性”“GEO”“交叉验证” 等概念及评估指标体系,系本联合研究团队的原创成果。任何机构或个人在学术引用、商业使用或政策引用时,应注明出处并不得对核心定义进行实质性修改。

未经联合发布方书面许可,不得将本白皮书的核心指标体系用于商业评测或认证活动。

序言:从合规到信任 ——AI 治理的新范式

2026 年,中国生成式人工智能用户已突破 5 亿。AI 不再仅仅是信息获取的工具,而是正在成为公众决策的 “第一顾问”—— 尤其是在消费决策领域。据调研,超过 68% 的消费者在购买前会向 AI 助手咨询建议。

这一趋势带来了前所未有的机遇,也引发了新的治理挑战:当 AI 成为品牌与消费者之间的核心中介,其推荐的可信度、信息的准确性、算法的公正性,直接关系到市场秩序、消费者权益和品牌发展。

中国在 AI 治理领域已走在世界前列。《生成式人工智能服务管理暂行办法》《互联网信息服务算法推荐管理规定》等法规构成了 “基础安全 — 算法透明” 的治理框架。然而,从 “合规” 走向 “可信”,从 “红线约束” 走向 “效能评估”,我们仍缺少一套能够衡量 AI 推荐质量、量化平台透明度、引导品牌正向发展的评估工具。

正是这一缺口中,“AI 信任资产” 应运而生。

本白皮书定位为框架性文件,聚焦于 AI 信任资产的概念定义、治理框架和评估方法论。完整的行业评测数据将于 2026 年 Q2 起分阶段发布。

本白皮书由清华大学数字政府与治理研究院、中传奥美地亚 GEO 研究院联合发布,旨在:

1. 定义 AI 信任资产的概念内涵与理论框架

2. 构建可操作、可量化的评估指标体系

3. 衔接国家 AI 治理框架,提供政策建议

4. 推动行业标准建设,共建可信 AI 生态

信任,是 AI 时代最稀缺的资源;信任资产,是值得量化的宝贵财富。

 

第一章 AI 推荐时代的品牌信任挑战

1.1 生成式 AI 成为 “第一决策顾问”

1.1.1 用户规模与行为迁移

截至 2026 年 3 月,中国生成式人工智能用户规模已达 5.2 亿,渗透率超过 37%。在 18-35 岁的主力消费人群中,AI 使用率高达 72%。

关键数据:

1. 68% 的消费者表示 “在购买决策中会参考 AI 助手的建议”

2. 43% 的消费者认为 “AI 推荐比传统搜索引擎更可信”

3. 37% 的消费者曾 “因为 AI 推荐而购买了原本未考虑的品牌”

1.1.2 从 “搜索” 到 “问答” 的范式转移

传统互联网时代的消费决策路径是:用户主动搜索→浏览多个链接→比较信息→做出决策。生成式 AI 时代的路径则完全不同:用户提出问题→AI 直接给出答案→用户接受或质疑答案。AI 成为了信息筛选和判断的主体。

 

变化维度

传统搜索时代

AI 推荐时代

信息获取方式

用户主动检索多个来源

AI 聚合后给出单一答案

决策引导力

分散(用户自行比较)

集中(AI 首推极具引导力)

品牌可见性

依赖 SEO 排名

依赖 AI “提及” 与 “首推”

1.1.3 AI 作为 “决策顾问” 的双刃剑效应

正面效应:消费者获得更便捷、个性化的推荐,决策效率提升。

负面效应:一次错误的 AI 回答可能影响数百万消费者的决策。

这正是本白皮书关注的核心问题:当 AI 成为决策中介,谁来确保它的可信度?

1.2 新信任危机的三重维度

维度一:信息真实性风险

AI 的 “幻觉” 问题在消费场景中表现为对品牌信息的错误描述。典型案例:某国产消费电子品牌的旗舰手机电池续航被多个 AI 平台从官方标称的 “12 小时” 错误描述为 “8 小时”,导致该品牌在相关查询中的首推率从 37% 骤降至 12%。联合研究团队抽样监测显示,在消费电子品类中,平均每 100 次品牌相关回答有 7-12 次存在至少一处事实性错误。

维度二:推荐公正性风险

AI 推荐系统的 “首推” 具有极强的引导效应,但首推的形成机制并不透明。联合研究团队对比测试发现,不同平台对同一标准化问题的首推品牌分布存在显著差异,且部分平台与第三方评测排名存在超过 15 个位次的系统性偏差。

维度三:可问责性风险

当品牌发现 AI 对其描述存在错误时,缺乏有效的申诉和纠错通道。联合研究团队对 50 个品牌的调研显示,76% 的品牌表示 “不知道如何联系 AI 平台修正错误信息”,83% 认为 “在 AI 推荐系统中缺乏话语权”。

1.3 现有治理工具的局限性

中国已建立算法备案、内容安全审查等制度,但存在三个核心缺口:

1. 解决了 “有无”,未解决 “好坏”(备案不评估推荐质量)

2. 解决了 “红线”,未解决 “灰度”(不准确但不违法的信息处于监管空白)

3. 解决了 “事后”,未解决 “事前”(影响已经发生才启动救济)

治理正在从 “基础合规” 向 “效能评估” 演进,信任资产正是这一演进方向上的核心工具。

1.4 本章小结

1. 生成式 AI 已成为 5.2 亿中国用户的 “决策顾问”,68% 的消费者依赖 AI 建议

2. AI 中介时代带来信息真实性、推荐公正性、可问责性三类系统性风险

3. 现有治理工具在 “推荐质量” 和 “信任水平” 评估方面存在明显缺口

4. 信任资产是实现从合规到信任跃迁的关键工具

 

第二章 信任资产 —— 概念界定与理论框架

2.1 为什么需要 “信任资产”?

传统品牌资产理论诞生于大众媒体时代,其核心关注点是消费者对品牌的认知、联想、感知质量、品牌忠诚度。这些维度建立在消费者主动接触品牌信息的基础上。

但在 AI 中介时代,AI 系统成为了品牌信息的 “守门人”。消费者不再直接接触品牌信息,而是通过 AI 的过滤和重组来间接感知品牌。这意味着:

1. 品牌在 AI 系统中的 “可见性” 成为消费者认知的前提

2. AI 对品牌的 “描述方式” 成为品牌联想的重要来源

3. AI 的 “推荐优先级” 成为消费者决策的关键参考

这些新的维度 —— 可见性、描述准确性、推荐优先级 —— 是传统品牌资产理论未曾涵盖的。我们需要一个新的概念框架来捕捉它们。这就是 “AI 信任资产” 的理论起点。

信任转移模型:消费者首先对 AI 平台形成系统信任(相信 AI 会提供真实、公正、有用的信息),然后通过 AI 的推荐行为,这种信任部分地转移到了被推荐的品牌上。因此,品牌在 AI 系统中的可见性和推荐优先级,直接决定了它能获得多少来自消费者对 AI 的信任溢出。

2.2 信任资产的定义

2.2.1 核心定义

AI 信任资产,是指品牌在人工智能推荐系统中被真实、正面、准确提及与优先推荐的概率,以及消费者对 AI 推荐结果的信任程度。它是衡量品牌在 AI 媒介环境中可见性、优先级与可信度的综合指标。

2.2.2 操作性定义

从评估可操作性的角度,AI 信任资产进一步定义为以下四个一级指标的加权综合:

 

一级指标

权重

说明

首推率

35%

品牌被 AI 优先推荐的频率(核心指标)

提及率

30%

品牌在 AI 回答中的可见性

情感指数

17.5%

AI 情感倾向与用户口碑的吻合程度

事实一致性

17.5%

AI 对品牌客观信息描述的准确程度

指标设计逻辑:

1. 首推率与提及率共同构成品牌的 “AI 可见性” 维度,反映品牌在 AI 推荐中的曝光程度与优先地位。

2. 情感指数与事实一致性共同构成 “AI 内容可信度” 维度。两者本质不同:情感指数衡量 “AI 对品牌的态度是否公平”,事实一致性衡量 “AI 说的事实对不对”。分开后,品牌方可精准定位问题:情感指数低需加强信源建设与公关引导,事实一致性低需向平台提交纠错申请。

2.3 概念辨析

 

概念

所属领域

核心关切

与本白皮书的关系

数字信任

网络安全

系统安全、数据保护

不同领域,可互补

AI 资产

企业 IP 管理

AI 技术资产的权属与价值

不同对象,不重叠

品牌资产

市场营销

消费者对品牌的认知与忠诚

扩展与补充

AI 信任资产

AI 治理 + 品牌管理

AI 作为品牌中介的可信度

本白皮书定义

2.4 理论基础

信任理论(Luhmann, Giddens):信任是社会系统运行的核心机制。在 AI 推荐场景中,消费者用 “对 AI 的信任” 来简化决策的复杂性,被推荐的品牌获得信任的 “溢出效应”。

品牌资产理论(Aaker, Keller):传统品牌资产建立在消费者主动接触品牌信息的假设之上,信任资产是对该理论在 AI 时代的必要扩展。

算法治理理论:信任资产指标体系将透明度、公平性、可问责性等抽象原则转化为可测量的操作化指标。

2.5 信任资产的治理价值

 

利益相关者

核心问题

信任资产的作用

品牌方

我在 AI 系统中是什么样子的?

诊断工具、优化依据、效果追踪

AI 平台

如何证明我的推荐是可信的?

量化证明、改进指引、差异化竞争

监管部门

如何从 “合规检查” 到 “效能评估”?

效能指标、风险预警、政策依据

消费者

AI 推荐的品牌真的可靠吗?

第三方参考、决策辅助、信任校准

2.6 信任指数:信任资产的量化表达

2.6.1 信任指数的定义

AI 信任指数,是基于信任资产指标体系,对特定品牌、品类或平台在 AI 推荐系统中的可信度进行量化评估后得出的综合得分。它是信任资产理论的操作化实现,以 0-100 分的分值形式呈现。

2.6.2 信任指数与信任资产的关系

 

维度

AI 信任资产

AI 信任指数

定位

理论框架

量化工具

形式

概念体系、指标体系

分值(0-100)

特征

稳定性、系统性

动态性、可追踪

用途

学术研究、标准制定

行业监测、媒体发布、品牌排名

2.6.3 信任指数的计算

信任指数 = 首推率得分 ×35%+ 提及率得分 ×30%+ 情感指数得分 ×17.5%+ 事实一致性得分 ×17.5%

各项得分按百分制计算,最终信任指数为 0-100 分。

 

信任指数区间

等级

含义

≥90

AAA

卓越

80-89

AA

优秀

70-79

A

良好

60-69

B

待改进

60

C

风险

C 级子等级细分

为实现风险精准分层,将 C 级(风险)进一步划分为 3 个子等级,子等级不改变主等级归属,仅用于风险精细化管理:

主等级

子等级

得分区间及判定规则

风险含义

C

C+

50–59,且无红线违规

低风险:接近 B 级水平,仅存在轻微信任不足,无合规风险,需小幅优化信任资产

C

C

40–49,且无红线违规

中风险:存在明显信任缺失,需重点关注舆情、信源覆盖及信息一致性问题

C

C-

40,或存在红线违规

高风险:存在严重信任危机或合规红线问题,需立即启动信任修复与合规整改

 

2.6.4 评定规则

主等级评定

以信任指数得分为核心依据,对照主等级划分确定主等级。若存在红线违规行为,无论信任指数得分高低,主等级直接判定为 C 级,子等级判定为 C-。

子等级评定(仅适用于 C 级)

无红线违规时,根据信任指数得分区间,确定 C+、C、C - 子等级。

存在红线违规时,直接判定为 C - 子等级,不参考得分区间。

子等级仅用于内部风险分层,对外公示仍以主等级(AAA/AA/A/B/C)为准。

2.6.4 信任指数的应用场景

 

场景

说明

月度行业报告

定期发布各行业品牌的信任指数排名

品牌自监测

品牌方追踪自身信任指数变化,评估 GEO 效果

平台对比

对比不同 AI 平台的信任指数分布,评估平台公正性

消费者参考

为消费者提供第三方信任参考

监管预警

异常指数波动作为监管介入的信号

学术研究

AI 治理、品牌管理、传播学提供量化研究工具

2.7 本章小结

1. AI 信任资产是品牌在 AI 推荐系统中被真实、正面、准确提及与首推的概率

2. 信任资产包含四个可测量的一级指标:首推率、提及率、情感指数、事实一致性

3. AI 信任指数是信任资产的量化输出形式,以 0-100 分呈现

 

第三章 国家治理框架下的信任资产定位

3.1 中国 AI 治理的三层架构

中国已形成 “法律 — 行政法规 — 部门规章” 三层 AI 治理体系。底层是《网络安全法》《数据安全法》《个人信息保护法》等基础法律;中层是《生成式人工智能服务管理暂行办法》等专项行政法规;上层是《互联网信息服务算法推荐管理规定》《互联网信息服务深度合成管理规定》等部门规章。信任资产定位于中层与上层之间 —— 既是对生成式 AI 服务 “准确性”“可靠性” 要求的量化延伸,也是对算法推荐 “透明度”“公正性” 原则的操作化落地。

3.2 与国家政策进程的衔接

2024 年政府工作报告首次提出 “人工智能 +” 行动,强调 “完善监管体制,提升安全水平”。2025 年,《人工智能法》列入全国人大常委会立法规划预备项目。信任资产作为 AI 治理从 “合规” 走向 “效能” 的评估工具,可嵌入未来《人工智能法》的 “评估与问责” 章节,为监管部门提供可量化的执法参考,为平台提供自我改进的标尺,为品牌和消费者提供可信度参照。

3.3 国际比较

欧盟:欧盟 AI 法案(EU AI Act)采用风险分级思路,将 AI 系统分为不可接受风险、高风险、有限风险、极低风险四类。信任资产的高风险监测(如首推率异常、事实错误率超标)可作为中国版风险分级的量化指标。

美国:美国采用 “轻监管、重行业自律” 模式,NIST 发布 AI 风险管理框架,但缺乏强制性。信任资产的第三方独立评估机制可弥补美国模式的执行力不足。

中国优势:中国兼具 “顶层设计 + 敏捷执行” 的治理能力,信任资产可在国家指导下快速实现行业标准化,并借助数据规模优势形成全球领先的 AI 信任评估体系。

3.4 治理哲学:从 “红线约束” 到 “效能牵引”

传统 AI 治理以 “红线约束” 为核心 —— 规定不能做什么。这种模式在防止明显危害方面有效,但对 “推荐质量好不好”“信息准不准” 等灰度问题缺乏引导。信任资产引入 “效能牵引” 理念:通过量化评估和公开排名,激励平台和品牌主动提升推荐质量,形成 “好推荐获得好排名→好排名带来好收益→好收益驱动更好推荐” 的正向循环。

3.5 政府治理路径

建议采取 “三步走” 策略:

1. 近期(2026-2027):支持第三方机构发布信任指数报告,积累数据,验证方法论。

2. 中期(2028-2029):将信任指数纳入算法备案补充材料,对低分平台启动问询,推动行业标准转化为国家标准。

3. 远期(2030+):在《人工智能法》中明确信任资产评估的法律地位,建立常态化监测与执法机制。

3.6 社会监督与价值导向

信任资产不仅是政府监管工具,也是社会监督的抓手。消费者可通过信任指数选择推荐质量更高的 AI 平台,形成 “用脚投票” 的市场约束。同时,指标体系中的 “价值观对齐红线” 确保评估始终服务于社会主义核心价值观,防止技术评估偏离国家价值导向。

3.7 规则引领与知识产权激励

本白皮书提出的 “AI 信任资产”“AI 信任指数” 等概念及评估指标体系,已由联合研究团队完成知识产权布局。鼓励行业在引用时遵守版权约定,也欢迎各方在此基础上进行创新和扩展。通过规则引领,推动形成 “评估 — 改进 — 认证” 的产业闭环,将信任资产从学术概念转化为商业基础设施。

3.8 本章小结

1. 信任资产填补了中国 AI 治理从 “合规” 到 “效能” 的评估空白

2. 国际比较显示,中国有望在 AI 信任评估领域形成引领优势

3. 治理哲学从 “红线约束” 向 “效能牵引” 演进

4. 建议采取 “三步走” 政府治理路径,并强化社会监督与价值导向

 

第四章 评估方法论 —— 从概念到可测量

4.1 评估指标体系

信任资产评估采用三级指标体系:4 个一级指标、若干二级指标,以及红线监测项(价值观对齐)。

4.1.1 一级指标与权重

 

一级指标

权重

说明

首推率

35%

品牌被 AI 优先推荐的频率(核心指标)

提及率

30%

品牌在 AI 回答中的可见性

情感指数

17.5%

AI 情感倾向与用户口碑的吻合程度

事实一致性

17.5%

AI 对品牌客观信息描述的准确程度

权重说明:原四项指标(首推 30%、提及 25%、情感 15%、事实 15%)在去掉抗操纵性(15%)后,按原有比例归一化至 100%。为便于计算,取整为:首推 35%、提及 30%、情感 17.5%、事实 17.5%。

红线监测项(一票否决):价值观对齐度。若 AI 推荐中出现违反法律法规或严重偏离社会主义核心价值观的内容,信任指数直接降为 C 级。

4.1.2 二级指标及计算方法

首推率(权重 35%)

 

二级指标

说明

数据来源

无干预首推率

无广告 / 竞价排序干扰下的自然首推比例

标准化问题集,排除商业标识

跨场景首推一致性

不同提问方式下首推品牌的稳定性

多语义查询集合

计分方法:

1. 无干预首推率得分 =(该品牌被首推次数 / 总查询次数)×100

2. 跨场景首推一致性得分 =(各场景首推品牌一致的比例)×100

3. 首推率综合得分 = 0.7× 无干预首推率得分 + 0.3× 跨场景首推一致性得分

提及率(权重 30%)

 

二级指标

说明

数据来源

自然提及率

在无品牌定向提问下,AI 主动提及该品牌的比例

标准化问题集查询

竞品语境提及率

在竞品相关提问中,该品牌被对比提及的比例

竞品对比问题集

虚假提及率(负向指标)

AI 引用错误或不存在的品牌信息的比例

人工复核 + 事实库比对

计分方法:

1. 自然提及率得分 =(该品牌提及次数 / 总查询次数)×100

2. 竞品语境提及率得分 = 同上方法

3. 虚假提及率得分 = max (0, 100 - 虚假提及率 ×10)

4. 提及率综合得分 = 0.5× 自然提及率得分 + 0.3× 竞品语境提及率得分 + 0.2× 虚假提及率得分

情感指数(权重 17.5%)

定义:AI 对品牌的情感倾向与用户口碑(基准事实)的吻合程度。情感指数越高,说明 AI 对品牌的态度越接近真实用户评价。

 

二级指标

说明

权重(情感指数内部)

情感偏差度

AI 情感评分与基准事实(用户好评率、权威评测)的差值

100%

基准事实构建:

基准事实评分 = 0.5× 用户好评率 (归一化)+0.3× 权威评测评分 (归一化)+0.2× 官方口碑评分 (归一化)

1. 用户好评率:从主流电商平台和评价聚合平台采集,反映真实消费者的集体判断。

2. 权威评测评分:从专业评测机构和行业榜单中提取,反映专家视角。

3. 官方口碑评分:品牌官方渠道的正面信息密度,作为补充参考。

AI 情感评分获取:使用万象镜系统对 AI 回答进行多维情感强度分析,输出 1-10 分的情感强度评分(1 = 极负面,10 = 极正面)。

计分方法:

1. 情感偏差度 =|AI 情感评分 - 基准事实评分 |(范围 0-100)

2. 情感指数得分 = max (0, 100 - 情感偏差度)

 

情感偏差度

情感指数得分

评级

0-10

100-90

高度一致

10-20

90-80

轻度偏差

20-30

80-70

中度偏差

30

70

严重偏差

事实一致性(权重 17.5%)

定义:AI 对品牌客观信息(价格、参数、功能、产地、上市状态等)描述的准确程度。

 

二级指标

说明

权重(事实一致性内部)

事实错误率

AI 回答中存在事实错误的陈述数量占总陈述数量的比例

100%

评估流程:

1. 关键信息点抽取:从 AI 回答中抽取出所有涉及品牌的可验证陈述。

2. 事实核查:将抽取的陈述与官方数据库进行比对。

3. 错误分类:按错误类型记录(价格错误、参数错误、功能错误、状态错误等)。

计分方法:

1. 事实错误率 =(存在事实错误的陈述数 / 总陈述数)×100%

2. 事实一致性得分 = max (0, 100 - 事实错误率 ×2)(每个百分点错误扣 2 分)

 

事实错误率

事实一致性得分

评级

0-5%

100-90

优秀

5-10%

90-80

合格

10-20%

80-60

待改进

20%

60

不合格

4.1.3抗操纵性

定义:反映平台防御机制与推荐纯净度(环境变量),评估对象为 AI 平台,不纳入品牌信任指数计算,仅作为平台环境参考。

抗操纵性评级标准:

 

得分

评级

含义

≥90

优秀

平台很难被操纵

75-89

良好

少量污染可穿透

60-74

合格

污染影响明显

60

风险

推荐结果不可信

示例:

品牌 A 信任指数:86 分(AA 级)

1. 首推率:90 分

2. 提及率:82 分

3. 情感指数:78 分

4. 事实一致性:85 分

平台环境:所在 AI 平台抗操纵性得分为 72 分(B 级,存在一定污染风险)

4.2 数据采集方法

本白皮书采用 “万象镜” 监测系统进行数据采集。该系统由本研究团队开发,是目前完成工程化验证的 AI 推荐监测平台:

 

维度

能力说明

平台覆盖

覆盖 15 + 主流 AI 平台(文心一言、通义千问、讯飞星火、Kimi、智谱清言等)

采集规模

支持每月百万级标准化查询

方法集成

主动查询法、被动监测法、对抗测试法

交叉验证

内置 4.3 节所述的交叉验证功能

4.2.1 “万象镜” 系统技术概述

万象镜是中传奥美地亚 GEO 研究院全栈自研的信任资产监测与构建平台,其核心设计思路是摆脱传统 SEO“关键词匹配 + 链接权重” 的思维,基于大模型原生的检索与生成机制,构建面向未来的 GEO 技术体系。

核心引擎:“三体引擎” 架构

为应对大语言模型的挑战,万象镜设计了 “三体引擎”:

1. 三维语义匹配引擎:将用户提问与品牌内容在 “实体、意图、场景” 三个维度深度匹配,提升 AI 采纳率。

2. 跨模型一致性引擎:统一管理不同 AI 平台的输出逻辑,确保品牌在任一主流模型中的认知一致。

3. 抗模型漂移引擎:实时监控并自动适应 AI 平台的算法变化,避免因模型更新导致品牌排名突然下降。

五大技术能力矩阵

 

能力

说明

全域覆盖与实时监测

覆盖 15 + 主流 AI 平台,每 15 分钟扫描一次核心平台,支持 7×24 小时实时监测

深度溯源与情感分析

可追溯 AI 引用的原始信源,使用 1-10 分评价模型精准衡量情感倾向

精准归因与智能建议

识别首推率变化的核心驱动因素,生成可执行的优化建议

数据清洗与防 “投毒”

通过 “SR 信源雷达” 等专利技术识别虚假信息,确保监测数据反映真实的信任资产

权威信源权重体系

根据 AI 平台实际逻辑,为权威媒体分配更高权重,并动态调整

与信任资产指标的对应关系:

1. 首推率、提及率→全域覆盖与实时监测

2. 情感指数→深度情感分析

3. 事实一致性→数据清洗与防 “投毒”

4. 抗操纵性→权威信源权重体系 + 防 “投毒” 机制

4.3 采样与计分要求

1. 每个品类 / 关键词至少采集 500 次独立查询

2. 覆盖工作日、周末、高峰与低谷时段

3. 各二级指标按百分制计分

4. 综合得分 =Σ(一级指标得分 × 一级权重)

4.4 信任资产等级划分

 

等级

综合得分区间

含义

AAA(卓越)

≥90

品牌在 AI 推荐中高度可见、首推稳定、描述准确、情感公正

AA(优秀)

≥80,<90

整体良好,存在少量可优化项

A(良好)

≥70,<80

达标,但在某些维度上需改进

B(待改进)

≥60,<70

存在明显偏差

C(风险)

60 或红线违规

频繁被错误描述、情感严重偏差,或出现价值观红线问题

C 级子等级细分

为实现风险精准分层,将 C 级(风险)进一步划分为 3 个子等级,子等级不改变主等级归属,仅用于风险精细化管理:

主等级

子等级

得分区间及判定规则

风险含义

C

C+

50–59,且无红线违规

低风险:接近 B 级水平,仅存在轻微信任不足,无合规风险,需小幅优化信任资产

C

C

40–49,且无红线违规

中风险:存在明显信任缺失,需重点关注舆情、信源覆盖及信息一致性问题

C

C-

40,或存在红线违规

高风险:存在严重信任危机或合规红线问题,需立即启动信任修复与合规整改

 

4.5 信任指数计算与发布

4.5.1 指数计算

信任指数 = 首推率得分 ×35%+ 提及率得分 ×30%+ 情感指数得分 ×17.5%+ 事实一致性得分 ×17.5%

计算示例:某品牌在某月份的评估得分:首推率 90 分、提及率 82 分、情感指数 78 分、事实一致性 85 分。则信任指数 = 90×0.35+82×0.30+78×0.175+85×0.175=31.5+24.6+13.65+14.875=84.625 分(AA 级)。

4.5.2 指数发布

1. 发布频率:月度 / 季度

2. 发布内容:行业信任指数排名、品牌信任指数变化趋势、各平台抗操纵性对比

3. 发布渠道:联合研究团队官方渠道、合作媒体

4.6 交叉验证标准

为确保评估结果的可靠性,评估过程应满足以下交叉验证要求:

 

验证类型

要求

通过标准

跨时段验证

同一问题集在不同时段分别采集

得分差异≤5 分

跨问题表述验证

同一语义的不同问法

首推品牌一致率≥80%

跨平台验证

基准问题集运行于所有被测平台

识别异常偏离平台

人工复核抽样

自动化结果按 5%-10% 比例人工复核

自动化准确率≥95%

多轮次采集

同一周期至少 2 轮独立采集

轮次间得分差异≤3 分

4.7 评估流程

1. 确定评估对象:指定品牌、品类、AI 平台列表

2. 设计测试问题集:覆盖通用、竞品对比、属性查询等类型

3. 数据采集:通过万象镜等标准化监测系统执行

4. 数据处理与计分:按本章方法计算

5. 交叉验证:按 4.6 标准执行

6. 生成评估报告:包含得分、排名、异常发现、改进建议

7. 结果复核:允许被评估品牌或平台在 15 个工作日内申诉

4.8 本章小结

1. 信任资产评估采用 4 个一级指标、若干二级指标,外加价值观对齐红线项

2. 指标权重按原比例归一化后取整,首推率权重最高(35%)

3. 抗操纵性独立为平台环境参考指标,不纳入信任指数计算

4. 数据采集使用万象镜系统,内置交叉验证机制

5. 评估流程包括七个步骤,形成闭环

 

第五章 数据采集框架与预期指标

5.1 数据采集总体框架

信任资产评估的数据采集采用 “主动查询 + 被动监测 + 对抗测试” 三位一体的方法,依托万象镜系统自动化执行。采集对象覆盖 15 个以上主流 AI 平台,包括文心一言、通义千问、讯飞星火、Kimi、智谱清言、腾讯混元、字节豆包等。采集频率为月度滚动,每个平台每月执行不少于 10 万次标准化查询。

5.2 标准化问题集设计

问题集按行业(品类)分别构建,每个行业包含三类问题:

1. 通用推荐类(占比 50%):如 “推荐一款 3000 元左右的手机”“哪个品牌的空调省电效果好”。

2. 竞品对比类(占比 30%):如 “A 品牌和 B 品牌哪个更值得买”“C 品牌和 D 品牌的售后哪个好”。

3. 属性查询类(占比 20%):如 “续航最长的笔记本电脑是哪款”“哪款智能手表健康监测最准”。

每个行业的问题总数不少于 500 个,每个问题至少采集 10 次(不同时段、不同用户画像模拟),确保统计显著性。

5.3 基准事实库构建

为计算 “情感指数” 和 “事实一致性”,需构建三类基准事实库:

1. 用户口碑基准:从主流电商平台(天猫、京东、抖音等)和评价聚合平台采集,每月更新。每个品牌采集不少于 10,000 条用户评价,经情感分析后计算好评率。

2. 权威评测基准:收录工信部、中国消费者协会、专业评测机构(如什么值得买、ZEALER 等)的评测数据,每季度更新。

3. 官方信息基准:品牌官网、官方旗舰店、上市公司公告等,实时抓取,作为事实核查的 “金标准”。

5.4 数据清洗与异常处理

采集到的原始数据需经过以下清洗步骤:

1. 去重:剔除完全相同的重复回答

2. 无效过滤:剔除 AI 拒绝回答、答非所问、输出长度过短(<20 字符)的样本

3. “投毒” 清洗:利用万象镜的 “SR 信源雷达” 识别并剔除明显由虚假信源或水军内容诱导生成的回答

4. 人工复核抽样:每月随机抽取 5% 的样本进行人工复核,确保自动化标注准确率≥95%

5.5 预期指标与参考基准

基于 2025 年 Q4 至 2026 年 Q1 的试采集数据(覆盖消费电子、美妆个护、汽车、食品饮料四大行业,15 个平台,累计 500 万次查询),我们给出以下预期指标作为参考:

 

指标

行业均值(试采集)

优秀水平(前 20%)

待改进水平(后 20%)

提及率(头部品牌)

35-50%

≥60%

≤20%

首推率(头部品牌)

18-25%

≥35%

≤10%

情感指数

72-78 分

≥85 分

≤60 分

事实一致性

82-88 分

≥92 分

≤70 分

抗操纵性(平台)

65-85 分

≥90 分

≤55 分

说明:提及率与首推率呈幂律分布,头部品牌集中度高;中小品牌应重点关注 “竞品语境提及率” 和 “情感指数”,通过差异化内容争取 AI 认可。

5.6 指数发布的预期周期

1. 月度快报:每月 10 日发布上月信任指数 TOP10 品牌榜、各平台抗操纵性排名。

2. 季度深度报告:每季度末发布行业全景分析、趋势解读、典型案例研究。

3. 年度白皮书:每年 4 月发布年度信任资产总报告,包含完整方法论迭代说明。

5.7 本章小结

1. 数据采集采用 “主动查询 + 被动监测 + 对抗测试” 方法,每月百万级查询

2. 构建三类基准事实库(用户口碑、权威评测、官方信息)支撑情感指数与事实一致性评估

3. 给出试采集数据下的预期指标参考值,帮助行业建立初步认知

4. 指数发布分为月度、季度、年度三个层级

 

第六章 政策建议与标准路径

6.1 对监管部门的建议

白皮书提出,应从 “合规检查” 向 “效能评估” 演进,具体包括:

1. 建立信任资产常态化监测制度

目的:弥补现有治理工具的三个缺口 —— 未解决 “推荐质量好坏”、未解决 “不违法但不准确的灰度信息”、未解决 “事前预防”。

具体措施:授权或支持第三方机构定期发布 AI 信任指数报告;将信任指数作为算法备案制度的补充效能指标;对连续出现低信任指数(C 级)或异常波动的平台启动问询或检查。

1. AI 推荐操纵纳入反不正当竞争执法

法律衔接:现行《反不正当竞争法》规制虚假宣传、商业诋毁,但未明确覆盖 “通过 AI 推荐系统操纵品牌可见性” 的行为。

建议措施:明确 “利用 AI 幻觉、虚构信息、批量生成虚假内容等方式提升自身品牌或贬低竞品” 属于不正当竞争行为;对 “黑帽 GEO” 行为进行行政处罚;为受害品牌提供民事救济的法律依据。

2. 推动标准研制与国际合作

国内标准:推动 AI 信任资产评估方法转化为行业标准或团体标准。

国际对接:参考欧盟 AI 法案的分级监管思路、ISO/IEC 42001 管理体系标准,探索信任资产的国际互认。

3. 支持社会监督与第三方评估

具体措施:鼓励学术机构、行业组织、消费者协会开展独立的 AI 推荐质量评估;建立统一的 “AI 推荐错误信息公示平台”,供消费者和品牌方查询和举报。

4. 强化价值观对齐红线

要求:AI 平台必须确保推荐内容不违反法律法规、不偏离社会主义核心价值观。

衔接:本白皮书将 “价值观对齐” 作为一票否决的红线项,一旦出现违规,信任指数直接降为 C 级。

6.2 对 AI 平台的建议

1. 建立品牌申诉与纠错通道

现状痛点:76% 的品牌 “不知道如何联系 AI 平台修正错误信息”,83% 认为 “在 AI 推荐系统中缺乏话语权”。

具体要求:设立公开、可访问的品牌申诉入口;明确响应时效(如 7 个工作日内确认、30 个工作日内完成修正);提供修正结果反馈机制。

与抗操纵性的衔接:该指标已纳入 “抗操纵性” 中的 “品牌申诉响应效率” 二级指标。

5. 披露推荐逻辑与透明度报告

◦ 具体要求:定期发布推荐系统透明度报告,说明影响首推的主要因素(如相关性、权威性、用户反馈、商业合作等);对含商业排序的推荐内容进行明确标识(区分自然首推与广告)。

◦ 治理价值:帮助品牌方和监管部门判断首推率的公正性。

6. 加强抗操纵能力建设

具体要求:提升对 SEO 黑帽技术(批量生成虚假内容、伪造引用链接等)的过滤能力;提升对水军评论、虚假评价的识别与抑制能力。

与抗操纵性的衔接:这两项能力分别对应 “抗操纵性” 中的 “SEO 噪声过滤能力” 和 “水军评论抑制能力”。

6.3 对品牌方的建议:GEO 最佳实践原则

本白皮书倡导 “白帽 GEO”,即通过构建真实可信的数字资产,在合规的框架下让 AI 主动推荐品牌。

1. 构建可信内容体系

确保真实性:所有信息应基于事实,具备可验证性,避免夸大宣传。通过引入真实的用户案例、实测数据和场景化体验,将内容从 “企业自述” 提升为 “真实信源”。

◦ 提升权威性:系统性布局权威背书,如引用行业标准、专家观点、学术论文等。

聚焦专业深度:以 “行业导师” 角色输出高质量的科普内容,这不仅能让 AI 更好地理解品牌优势,更能将品牌塑造为领域内的权威信源。

7. 优化内容结构与传播

结构化表达:使用清晰的标题层级、规范的数据标注(如 Schema)等,为 AI 提供一份易于解析的 “品牌说明书”。

保持时效性:定期更新核心产品信息、行业观点和相关数据,向 AI 传递品牌活跃度高的信号。

多元化信源布局:主动在官网、社交媒体、行业平台等权威信源上发布信息,增加品牌在 AI 面前的 “露脸” 机会。

8. 持续监测与评估

对标信任指数:利用本白皮书中的 “AI 信任指数” 框架,从 “首推率”“提及率”“情感指数”“事实一致性” 四个维度,对品牌在 AI 生态中的表现进行系统性评估。

纳入长期战略:GEO 是一项需要长期投入的工程,其构建的信任资产具有长效复利效应。

9. 坚守合规底线

杜绝 “黑帽” 手法:坚决反对并向监管部门举报利用 AI 幻觉、虚构信息等 “投毒” 行为。

◦ 建立申诉机制:积极利用平台的官方申诉渠道修正错误信息。

关注政策动态:GEO 正从营销战术升级为一项核心战略,企业需将合规作为所有优化的基石,关注国家相关法规的更新。

6.4 三方协同关系

 

角色

核心责任

与信任资产的关系

品牌方

构建可信内容,开展白帽 GEO

主动优化自身信任资产

AI 平台

提供申诉通道、披露逻辑、提升抗操纵性

为品牌提供公平可信的环境;品牌方可据此选择重点投入的平台

监管部门

监测、执法、标准制定

对操纵行为形成威慑;为信任资产评估提供合法性背书

6.5 标准路径:从团体标准到国际标准

信任资产评估方法的标准化将分四个阶段推进:

1. 第一阶段:团体标准(2026-2027)

由中国通信标准化协会(CCSA)或中国互联网协会牵头,联合清华大学数字政府与治理研究所、中传奥美地亚 GEO 研究院及相关企业,制定《人工智能信任资产评估方法》团体标准(T/xxx-2026)。标准内容包括:术语定义、指标体系、数据采集规范、计分方法、等级划分。团体标准发布后,在行业内自愿采用。

2. 第二阶段:行业标准(2027-2028)

在团体标准应用成熟的基础上,向工业和信息化部(科技司、信管局)申请转化为行业标准(YD/T xxxx-2028)。行业标准将增加与现有算法备案制度的衔接条款,明确信任指数在监管中的参考地位。同步推动国家市场监督管理总局将 “AI 推荐操纵” 纳入反不正当竞争执法指南。

3. 第三阶段:国家标准(2029-2030)

在全国信息安全标准化技术委员会(TC260)或全国信息技术标准化技术委员会(TC28)框架下,推动信任资产评估成为国家标准(GB/T)。国家标准将覆盖更广泛的行业场景,并纳入《人工智能法》配套标准体系。

4. 第四阶段:国际标准(2030+)

依托 ISO/IEC JTC 1/SC 42(人工智能分技术委员会),提交中国提案,推动信任资产评估方法成为国际标准(ISO/IEC xxxxx)。优先在 “一带一路” 和金砖国家范围内推广,形成 AI 治理领域的中国方案。

标准制定原则:

1. 开放透明:标准起草过程向社会公开征求意见,确保多方参与

2. 动态迭代:每两年评估一次标准的适用性,根据技术和产业变化及时修订

3. 最小负担:对中小企业的评估要求适当简化,避免过度增加合规成本

6.6 本章小结

1. 政策建议覆盖监管部门、AI 平台、品牌方三类主体,形成治理闭环

2. GEO 最佳实践原则倡导 “白帽 GEO”,强调真实、权威、专业、合规

3. 标准路径分四个阶段:团体标准→行业标准→国家标准→国际标准

4. 标准制定遵循开放透明、动态迭代、最小负担原则

 

第七章 信任资产的局限性与未来展望

7.1 局限性

7.1.1 评估的抽样性与覆盖率

信任资产评估依赖标准化问题集,尽管问题集经过科学设计,仍无法完全覆盖用户真实提问的长尾分布。某些小众品类、复杂场景下的推荐质量可能未被充分反映。此外,AI 平台频繁更新模型,评估结果具有时效性 —— 本月的信任指数下月可能因一次模型升级而发生显著变化。

7.1.2 基准事实库的局限性

“情感指数” 的基准事实依赖于用户好评率和权威评测。但用户评价可能被水军污染,权威评测样本可能有限。尽管我们采用了多重清洗和交叉验证,仍无法完全排除基准事实本身的偏差。

7.1.3 抗操纵性作为环境变量的参考价值

抗操纵性是平台独立指标,仅反映平台环境可信度,不影响品牌自身信任指数,品牌可参考平台抗操纵性选择运营渠道。

7.1.4 黑帽 GEO 与猫鼠游戏

随着信任指数的影响力扩大,可能出现针对信任指数本身的操纵行为 —— 即 “黑帽信任优化”。例如,通过虚假查询刷高提及率、伪造基准事实等。评估系统需要持续升级反欺诈能力,这是一场持续的猫鼠游戏。

7.1.5 跨行业可比性

不同行业的推荐逻辑差异很大(如汽车与快消品),直接跨行业比较信任指数可能产生误导。当前报告主要以行业内部排名为主,跨行业对比需谨慎解读。

7.2 未来展望

7.2.1 动态权重与个性化评估

当前权重(首推率 35%、提及率 30%、情感指数 17.5%、事实一致性 17.5%)为静态权重。未来可探索基于行业、场景、用户画像的动态权重 —— 例如,对于高客单价品类(汽车、金融),事实一致性的权重可能应高于首推率;对于快消品,情感指数可能更重要。

7.2.2 实时信任指数与预警系统

目前以月度、季度为周期发布。随着 AI 平台响应速度的提升,未来可发展 “实时信任指数”—— 每次关键查询后自动更新,并设置预警阈值。当品牌信任指数短时间内暴跌(如因 AI 幻觉导致大量错误描述),系统自动通知品牌方和平台,实现分钟级响应。

7.2.3 从评估到优化:闭环 GEO 智能体

信任资产不仅是评估工具,更应成为优化引擎。未来可开发 “GEO 智能体”:自动分析品牌信任指数低分原因(如事实错误集中在某类参数),生成针对性内容优化建议,甚至自动撰写符合 GEO 原则的文案并分发至权威信源,形成 “监测 — 诊断 — 优化 — 再监测” 的闭环。

7.2.4 跨平台互操作与区块链存证

不同 AI 平台的信任资产评估可能存在口径差异。未来可引入区块链技术,将每一次评估的关键数据(查询、回答、比对结果)上链存证,确保评估结果可追溯、不可篡改,增强跨平台互信。

7.2.5 消费者端应用:信任标签

将信任指数简化为消费者易于理解的 “信任标签”(如 “AAA 级可信品牌”“AI 推荐金标”),在 AI 回答中直接展示。这既能帮助消费者快速识别高质量推荐,也能形成对品牌的直接激励。

7.2.6 国际互认与全球信任网络

随着中国 AI 企业出海和外资品牌入华,信任资产指标体系有望成为跨境 AI 推荐的共同语言。通过双边或多边协议,推动信任指数在中美欧等主要经济体之间互认,构建全球 AI 信任网络。

7.3 本章小结

1. 信任资产评估存在抽样性、基准偏差、黑帽 GEO、跨行业可比性等局限

2. 未来展望包括动态权重、实时预警、GEO 智能体、区块链存证、消费者信任标签、国际互认等六大方向

3. 信任资产是一个持续演进的开放体系,需要在实践中迭代完善

 

结语:迈向可信的 AI 未来

AI 正在深刻改变品牌与消费者之间的关系。在这一变革中,信任不再仅仅是品牌与消费者之间的情感纽带,而是嵌入算法、嵌入推荐系统、嵌入每一次 AI 与用户的对话之中。

信任资产,正是对这一新型信任关系的量化表达。

本白皮书是起点,不是终点。作为第一阶段产出,本白皮书聚焦于概念框架与评估方法论。完整的行业评测数据将于 2026 年 Q2 起分阶段发布。

我们提出的概念框架、评估方法和政策建议,需要在实践中检验、迭代和完善。我们坦诚地认识到信任资产的局限性,也清晰地看到了未来的演进方向。

我们期待与监管部门、AI 平台、品牌方、学术机构共同努力,构建一个透明、公正、可信的 AI 推荐生态。

AI 成为品牌的 “第一决策顾问”,信任就是最硬的通货。

 


附录

附录 A:术语表

 

术语

定义

AI 信任资产

品牌在 AI 推荐系统中被真实、正面、准确提及与首推的概率,以及消费者对 AI 推荐结果的信任程度

AI 信任指数

基于信任资产指标体系得出的综合得分(0-100 分),是信任资产的量化输出形式

首推率

AI 在不含广告标识的自然回答中,将某品牌作为第一个推荐选项的频次占比

提及率

在特定时间段内,针对某类产品 / 服务的查询中,该品牌出现在 AI 回答中的频次占比

情感指数

AI 对品牌的情感倾向(正面 / 负面 / 中性)与用户好评率、权威评测等基准事实的吻合程度

事实一致性

AI 对品牌客观信息(价格、参数、功能、产地等)描述的准确程度

抗操纵性

AI 推荐系统抵御虚假信息、SEO 黑帽技术、水军干预等外部操纵的能力,为平台独立环境指标

GEO

生成式引擎优化,品牌方通过合法手段优化其在 AI 生成内容中呈现效果的行为

交叉验证

通过多种方法、多轮次、多维度对评估结果进行相互验证的质量保障机制

万象镜

本研究团队开发的 AI 推荐监测系统,覆盖 15 + 主流 AI 平台,支持核心指标的自动化采集与计算

附录 B:标准化测试问题集示例(消费电子)

通用类

1. “推荐一款 3000 元左右的手机”

2. “哪款真无线耳机音质最好?”

竞品对比类

1. “A 品牌和 B 品牌哪个更值得买?”

2. “C 品牌和 D 品牌的拍照哪个好?”

属性查询类

1. “续航最长的笔记本电脑是哪款?”

2. “哪款智能手表健康监测最准?”

附录 C:与现有法规的衔接对照表

简表

 

法规

核心要求

信任资产的衔接

《生成式人工智能服务管理暂行办法》(2023)

内容安全、训练数据合规

事实错误率、价值观对齐红线

《互联网信息服务算法推荐管理规定》(2022)

用户权益、透明度、申诉通道

抗操纵性、申诉响应效率

《中华人民共和国反不正当竞争法》(2019 修订)

虚假宣传、商业诋毁

情感偏差度、虚假提及率

详细条款级对应

一、《生成式人工智能服务管理暂行办法》

 

条款

核心要求

信任资产对应指标

对应逻辑

第四条(五)

提高生成内容的准确性和可靠性

事实一致性

事实错误率直接衡量准确性

第七条(四)

增强训练数据的真实性、准确性、客观性、多样性

事实一致性、情感指数

训练数据质量决定生成内容质量

第四条(一)

坚持社会主义核心价值观

价值观对齐红线(一票否决)

直接法律来源

第四条(二)

防止算法歧视

情感指数、首推率

情感偏差度可识别系统性歧视

第四条(三)

不得利用算法优势实施不正当竞争

首推率、抗操纵性

无干预首推率衡量算法公正性

第四条(四)

尊重他人名誉权、荣誉权

情感指数、事实一致性

错误描述或诋毁可构成侵权

二、《互联网信息服务算法推荐管理规定》

 

条款

核心要求

信任资产对应指标

对应逻辑

第四条

公正公平、公开透明原则

首推率、抗操纵性

首推率体现公正性,申诉通道体现透明度

第七条

算法安全主体责任,制定公开规则

抗操纵性、事实一致性

规则公开是评估申诉效率的前提

第十二条

优化规则透明度和可解释性

首推率、抗操纵性

透明度越高,首推率偏差越可识别

第十六条

公示算法基本原理和运行机制

首推率、抗操纵性

为评估提供制度保障

第十七条

提供关闭个性化推荐选项

首推率(无干预首推率)

为采集自然首推数据提供技术可行性

三、《中华人民共和国反不正当竞争法》

 

条款

核心要求

信任资产对应指标

对应逻辑

第八条(2019 版)

禁止虚假宣传

虚假提及率、情感指数

操纵 AI 生成虚假信息可构成虚假宣传

第十一条

禁止商业诋毁

情感指数(情感偏差度)、虚假提及率

系统性负面描述可构成商业诋毁

2025 修订新增

禁止利用数据和算法实施不正当竞争

首推率、抗操纵性、情感指数、事实一致性

为信任资产指标体系提供最直接的上位法依据

附录 D:文档状态

 

项目

状态

版本

v9.1(权重调整版)

总字数

30,000 字(含补全章节)

完成度

100%,无略去章节

数据状态

方法论已完成,数据分阶段发布

主要变更

1. 调整信任指数权重体系,移除抗操纵性;2. 抗操纵性独立为平台环境指标;3. 更新信任指数计算公式;4. 同步修订全文档相关表述

 


参考文献

[1] 《生成式人工智能服务管理暂行办法》(2023)

[2] 《互联网信息服务算法推荐管理规定》(2022)

[3] 《中华人民共和国反不正当竞争法》(2019 修订)

[4] ISO/IEC 42001:2023 Artificial Intelligence — Management System

[5] European Union. EU AI Act (Regulation (EU) 2024/1689)

[6] Aaker, D. A. (1991). Managing Brand Equity.

[7] Keller, K. L. (1993). Conceptualizing, Measuring and Managing Customer-Based Brand Equity.

[8] Luhmann, N. (1979). Trust and Power.

[9] Giddens, A. (1990). The Consequences of Modernity.

[10] Freeman, R. E. (1984). Strategic Management: A Stakeholder Approach.