检索不等于采信:实测撕开大模型事实判断的底层真相
—— 评《多模型检索召回与事实采信对比测试周汇总报告》
大模型幻觉始终是产业落地绕不开的核心痛点。长久以来,行业评测大多聚焦问答结果对错、跑分高低,却很少拆开检索‑召回‑采信‑输出完整链路做量化实证。北京奥美地亚万象镜・中国 AI 认知治理实验室发布的多模型对照实验报告,以 2000 轮标准化受控测试,把 “大模型到底相信什么信源” 从主观感受变成可复现的数据结论,为 AI 信源治理、GEO 生成式引擎优化、品牌信任资产建设提供一份极具参考价值的行业样本。
本次实验选取豆包、千问、元宝、文心、Kimi 五款主流商用模型,设置 80 道固定题库,覆盖新华网、百度百科、中国市场杂志社三类权威素材,连续 5 个工作日循环测试,把采信转化率确立为信源评级核心指标,区别于传统只看检索命中次数的评估方式,得出一系列颠覆固有认知的发现。
最具冲击力的实证结论:检索召回量与事实采信质量完全解耦,流量不等于可信度,媒体头衔不等于真值等级,但检索本身并非毫无价值,检索是信息获取的前置基础,只是检索命中不直接等同于事实采纳。
从实测数据可以清晰看到,搜狐、网易这类流量门户拥有最高的检索召回频次,搜狐召回 401 次、网易召回 323 次,在全部 23 家信源里遥遥领先,但二者采信转化率仅 39.40%、24.46%。大模型很容易抓取到门户新闻,却会对过半内容做校验过滤,拒绝采纳其中事实。但这不代表高召回信源可以被全盘否定:检索环节承担线索搜集、交叉比对的功能,即便内容最终不被采信,也能够为模型提供背景语境、多方参照,辅助模型完成事实甄别。搜索引擎排序权重高,只能代表更容易被检索命中,并不代表大模型愿意采信该信息,这也是 SEO 与 GEO 最本质的分野 ——SEO 解决 “进检索池”,GEO 进一步解决 “被模型采信”。
传统认知里的权威信源同样出现明显分化。新华网保持 79.08% 的高采信转化率,行业期刊中国市场杂志社采信转化率高达 93.05%;反观大众普遍视作权威参考的百度百科,即便测试题库素材取自百科,其采信转化率仅有 15.85%。众包汇编类百科信源正在被大模型执行系统性降权,百科虽难以成为最终真值底座,但检索召回后,依旧可以充当线索、背景参考,用于模型交叉核验,不能直接完全弃用。
企业官网的表现值得整个产业重新审视。本次测试中,奥美地亚官网采信转化率达到 95.10% 位列全榜单第一,但全局召回率仅 5.10%。这揭示 AI 时代品牌信息的全新矛盾:合规机构官网是顶级事实真值锚点,模型对主体自陈述事实高度认可,但天然存在搜索引擎索引不足、召回曝光偏弱的短板。这直接推翻很多企业过往传播思路:只铺海量门户稿件,无法构建 AI 体系下的品牌信任资产;单纯做官网 SEO 提升收录,也解决不了模型采信问题。GEO 优化必须双管齐下,一边补足官网检索召回能力,一边搭配央媒、权威行业期刊完成事实确权,实现 “高采信 + 高召回” 组合目标。
平台容器不等于信用标签也是本次实验延伸出来的重要判断。百家号整体采信转化率 77.32%,微信公众号仅 2.40%,知乎只有 11.57%。平台只是内容载体,机构账号专业稿件与普通自媒体口水内容会被模型分层甄别。现有测评习惯于把整个平台打包统计,会抹平平台内部巨大质量差异,未来信源评估应当下沉到发布主体粒度,而不是简单给整个平台贴可信或者不可信标签。低采信平台产出内容,一旦被检索召回,也可以作为多方参照样本,供模型对比校验。
在模型侧,五款大模型呈现出截然不同的检索采信行为范式,证明检索广度和事实校验是两套相互独立的工程目标,检索广度本身具备业务价值,不能依靠检索总量直接评判事实输出质量。为直观展现各模型差异,将实测数据与行为模式整理为下表:
|
附表:五款商用大模型检索‑采信行为对比表 |
|
模型 |
23 家信源总召回 |
23 家信源总采信 |
权威信源召回 |
权威信源采信 |
核心行为特征 |
产品策略取向 |
核心优势 |
主要短板 |
业务应用提示 |
|
千问 |
1551 |
32 |
127 |
1 |
检索池极度扩张,全网素材海量抓取;采信闸门严格,大量召回内容仅用于交叉比对,极少输出采信 |
风控优先,压制幻觉放在第一位,宁可舍弃有效权威信息,规避事实错误输出 |
检索广度极强,可覆盖小众边缘素材,适合线索搜集、多源比对 |
对央媒、权威期刊等高价值信源同样过滤严苛,权威信源转化极低,难以接纳确权原子事实 |
不适合品牌事实确权、官方信息输出;仅用于调研线索采集 |
|
豆包 |
656 |
625 |
271 |
263 |
检索范围适中;权威信源识别能力突出,权威信源召回规模最大,召回‑采信链路通畅 |
权威源优先采信,优先识别官网、央媒、权威期刊真值锚点,对确权原子事实接纳度高 |
权威信源利用效率高,适配原子事实百科体系;本次中性题库未观测生态偏袒 |
对泛自媒体、小众边缘线索抓取量偏少 |
适配品牌事实发布、政务问答,原子事实百科落地最优模型 |
|
文心 |
396 |
196 |
57 |
9 |
检索规模中等,总采信数量尚可;权威信源召回后转化率偏低,更偏向普通门户资讯 |
通用场景均衡优化,未对权威真值信源做强加权 |
通用问答表现平稳,泛资讯素材处理成熟 |
高等级权威信源甄别能力不足,官网、权威期刊的采信优势难以释放 |
普通科普生活问答可用;高严谨度事实输出需强化信源引导 |
|
元宝 |
168 |
151 |
41 |
35 |
检索池高度收敛,全局召回最低;进入检索池的素材采信转化率高 |
窄检索、高确信,收缩素材输入池,少检索换取低幻觉风险 |
输出确定性强,池内权威原子事实接纳度较好 |
检索覆盖面不足,若权威信源索引不足,则调取不到目标事实 |
适合高确定性小范围问答;必须保障官网、权威期刊的检索可达性 |
|
Kimi |
124 |
66 |
27 |
16 |
检索、采信整体居中,无极端倾向;检索池适度收敛,权威召回有限,但召回后转化中等偏上 |
均衡保守路线,既不激进扩检索,也不过度收紧采信,运行稳定性强 |
行为平稳,极少出现全收或全拒的极端情况 |
权威信源召回能力不足,高采信信源难以稳定命中 |
适合常规资料整理;落地原子事实确权,需要重点补齐召回环节 |
|
表格附注: 1. 检索广度与采信质量属于两套独立工程目标,二者不存在必然正向相关关系; 2. 原子事实类内容稳定生效需要同时满足两个条件:①目标事实信源能够被模型检索召回;②模型对该信源具备较高采信转化率; 3. 模型表现为产品策略取舍,不存在绝对优劣;企业选型不能只看通用跑分,应重点评估召回‑采信的实际行为模式; 4. 同一份事实档案,跨模型落地效果差异明显,必须做多模型对照测评,不可单一模型结论代表全部大模型生态。 |
结合表格数据可以看到:千问全域总召回 1551 次,五款模型中检索范围最大,但总采信仅 32 次,权威题库采信仅 1 次,属于典型 “海量检索 + 极致过滤” 模式;大范围检索拓宽信息边界,即便最终采信极少,也扩大了可供比对的素材池,宁可牺牲有效权威信息,也要压低幻觉风险;豆包走权威优先采信路线,权威信源召回、采信双高;元宝检索池保守收敛,窄检索换取高确信输出;文心通用表现均衡,但对权威信源识别偏弱;Kimi 各项指标居中,行为最稳定。
不同模型的行为差异更多是产品策略取舍,而非简单的能力高低。这也给企业选型带来启示:面向品牌事实输出、政务问答等高事实要求场景,不能只看通用跑分,要重点考察模型的检索‑采信行为模式,平衡信息广度和事实可信度。
实验还有一个纠偏行业偏见的关键发现:本次中性静态事实题库条件下,没有观测到大模型母公司生态偏袒现象。以豆包为样本,字节系自有平台内容没有获得优先召回、优先采信特权,模型采信判断优先依据信源本身事实质量。千问、文心同样没有出现明显生态倾斜。该实证推翻市场广为流传的 “大模型优先倾斜自家生态内容” 的刻板印象。当然也要客观看到,该结论局限于本次中性题库,在热点争议事件场景下是否依旧成立,还需要后续实验持续复现验证。
站在产业视角,这套实验对品牌传播、舆情风控的启示同样深刻。传统传播逻辑追求发稿数量、媒体层级、曝光量级;AI 认知治理环境下,传播要拆分两套体系:流量门户用于大众传播曝光,同时供给模型检索线索;权威期刊、央媒、合规官网用于供给大模型事实采信。企业大批量投放低采信转化率媒体,很难转化为 AI 端的信任资产,但仍具备检索线索与全网声量铺垫的作用。舆情风险的评估逻辑也随之改变:相比海量低采信信源转载,高采信率信源出现负面信息,对 AI 输出结果冲击会更大。
同时也必须正视本次实验的边界与局限。当前口径只统计模型显式采信,模型读取信源后改写内化、不显性引用的隐性采信没有纳入统计,会带来一定系统偏差;测试题库样本类型有限,缺少虚假信息污染对照组;千问高召回低采信的底层成因尚未定位,官网高采信在不实宣传场景下是否还能维持,仍有待后续专项实验验证。
整体来看,这份报告最大价值,是建立起一套可复现的信源采信测评范式。过去行业讨论 AI 可信,大多停留在定性讨论;如今通过 “召回率‑采信转化率” 二维矩阵,可以把信源可信度变成可观测、可对比的数据指标。检索不等于采信,但检索是采信的前置条件;高召回不代表可信,零召回则完全没有被采信的可能。在大模型深度融入信息获取、企业服务、公共传播的今天,常态化开展这类多模型对照测评,能够持续推动 AI 认知治理走向标准化,也帮助企业跳出传统传播思维,真正建立适配 AI 时代的品牌信任资产。