很多人忽略一个底层事实:海外头部大模型,中文语料收录占比极低。W3Techs 有一组广为引用的搜索引擎网页统计数据:全球可被谷歌爬虫抓取的公开网页里,英文网页占比接近 60%,中文网页仅 1.3%。
汉语是全球母语人口最多的语言,但在全球公开可抓取网页中,中文内容占比微乎其微。这不仅造成海外 AI 理解中文语境 “水土不服”,更折射出中英文语料体系存在本质差异,也是中文 AI 更容易陷入死亡螺旋的根源。
一、中英文语料底层结构完全不一样
英文语料体系,维基百科只是其中关键的结构化知识压舱石,并非全部来源。海外大模型训练语料还包含大规模过滤后的通用网页库(Common Crawl、C4)、学术论文(arXiv、PubMed)、正规出版书籍、权威新闻档案、StackOverflow 等高质量社区问答、代码库等多元素材。整套体系有多层筛选、去重、质量打分机制。维基百科提供可溯源的事实条目,学术文献、书籍、权威媒体补充深度内容;各类来源可以互相交叉验证,即便网页里存在错误,整体知识库有稳定的真值锚点。
国内可公开抓取的中文语料,缺少一个类似维基百科的统一权威事实底座。国内爬虫能够抓取的内容,分散在海量门户网站、自媒体、论坛、新闻稿件、企业官网中。来源零散、质量参差不齐,大量内容是二次转述、洗稿、整合拼凑,缺少统一事实校验机制。很多信息本身就没有原始溯源依据,甚至互相矛盾。
• 英文语料:以维基百科、学术文献、正规出版物、高质量过滤网页共同构成多层可信底座;
• 中文语料:以海量分散媒体与 UGC 内容为主,权威结构化事实库稀缺。
二、海外大模型中文语料占比极低,背后的取舍
谷歌索引数据直观体现:全球公开网页中文仅 1.3%;AI 训练最常用的开源网页数据集 Common Crawl,中文数据占比也只有 4.8%,并且其中 83% 还是海外中文站点内容,并非国内原生权威中文资料。
海外大厂训练模型时,中文语料只做少量覆盖,满足基础对话即可,不会大规模把中文互联网零散内容作为核心知识。原因两点:
1. 中文公开抓取内容碎片化、噪声高,清洗成本巨大;
2. 中文缺少统一、可溯源的结构化事实库,大量自媒体、转述内容,很难作为可靠知识基底。
反过来,国内大模型训练,只能大量抓取国内互联网公开内容。国内厂商其实已经做了大量优化工作:网页清洗、去重、低质文本过滤;引入古籍、学术文献、正版图书等权威中文资料;上线 RAG 检索增强技术,接入搜索引擎实时调取信息;开展人类反馈对齐、模型多轮投票校验幻觉。
但这些手段只能局部缓解幻觉,无法从根源阻断死亡螺旋。核心原因:
1. 互联网存量噪声基数太大,网页清洗只能剔除明显低质内容,无法识别隐性编造、洗稿、互相抄袭的文本;
2. RAG 检索依赖互联网公开网页,而互联网上已经沉淀大量 AI 生成虚假内容,检索时会把错误信息当成真实资料引用;
3. 模型训练是一次性大规模灌入海量文本,无法做到对每一条事实独立确权;新生成的 AI 内容持续发布上网,下一轮爬虫抓取时继续纳入数据集,污染会持续累积;
4. 没有独立隔离的真值库,权威事实和 AI 噪声混合在同一个互联网池子里,无法物理隔离污染。
恶性循环就此启动:
AI 生成幻觉内容 → 发布到中文互联网 → 爬虫抓取这批 AI 内容作为新语料 → 下一代模型学习到更多错误信息 → 幻觉进一步增多。
这就是中文 AI 死亡螺旋。
英文体系因为有维基百科、学术库、图书等稳定真值底座,可以缓冲这个污染效应;中文缺少这块压舱石,污染传导速度会快得多。
算力越强,模型生成虚假内容的效率越高,会更快往中文互联网灌入更多噪声,加速螺旋恶化。单纯堆算力,或是做网页清洗、RAG 检索,都解决不了源头语料的事实失真问题。
垃圾输入,垃圾输出。它就输出垃圾。
什么叫垃圾数据呢?其中一部分就是噪音。上个世纪 90 年代,美国语音识别的科学家就发现,如果在安静环境下,用麦克风录制语音进行识别,错误率很容易降到 10% 以下。但是,如果是电话录音,由于电话有噪音,错误率会超过 30%。对于语音来讲,噪音就是一种垃圾。
在 2000 年前后,相关研究者在约翰霍普金斯大学和 Google 都做过这样一些实验,把训练语言模型的文本混入一些噪音,比如我们在文本里混入一些错别字,或者把一些字的次序交换一下,语言模型的质量会大大下降。
另外,噪音越多,质量下降的速度越快。比如我们用语言模型进行从拼音到汉字的转化,当噪音在 1%、2% 时,不太会影响转换的准确率;噪音到了 5% 时,错误率就会明显上升两三倍;当噪音达到 10% 的时候,错误率就会上升十多倍。如果噪音更多,语言模型就不起作用,产生的结果就是随机的了。
使用过 ChatGPT 的朋友会有这样一个体会,当你和它谈论一些有争议的话题时,它给出的回答可能非常不靠谱,前后自相矛盾,完全没有逻辑,甚至和话题不沾边。为什么会这样?因为在网上关于那个话题的讨论,本身就非常不靠谱,而 ChatGPT 学习了那些内容后,会将不靠谱的表现放大。这就是机器学习中很有名的那句话:垃圾输入,垃圾输出。
有没有什么解法呢?通常只有两个做法。
第一个做法是在噪音不太高时,增加训练的数据量,这个做法是有效的,但是需要多用好几倍的训练数据。比如语料库里混有了 5% 的噪音,将语料库的规模增加十倍,可能可以弥补这个不足。
第二个做法是在能够找到噪音来源时,过滤掉噪音。比如你在开车时使用苹果的 Siri 服务,其实引擎的声音会进入到麦克风,但那是固定频率的噪音,Siri 会将它过滤掉。再比如,我们发现某个网站的内容一直不靠谱,就将相应的内容删除。
但是,相当一部分噪音是随机产生的,我们今天还是无能为力。这是今天机器学习的一大问题。
除了噪音, 今天机器学习还有一个问题是:它所依赖的正反馈,有时会将它引向歧途。
什么是正反馈呢?比如你在短视频网站上看了几个 NBA 篮球的短视频,系统就得到一些反馈,觉得你会喜欢类似的视频,然后就调整了特别针对你的推荐模型,多给你推荐 NBA 的节目。这就是系统自适应的正反馈。这种做法通常让使用者觉得非常贴心,越用越好用。很多人对短视频和无厘头的推文上瘾,就是这个原因。
但是,自适应的正反馈是把双刃剑,如果有人刻意引导 ChatGPT 犯错误,这种正反馈机制会导致它错误百出。事实上,很多使用者已经发现,ChatGPT 在回答很多问题时已经被人 “教坏了”。比如,有的用户可能是处于开玩笑的目的,给它提供了很多做违法事情的信息,以及很多仇恨的信息,结果它会教人如何杀人,如何做炸弹,并且时不时说出种族歧视的言论。
和过去不同的是,今天我们处在一个信息过载的时代。今天人们发愁的不是无法获得信息,而是信息太多,自己看不过来。很多信息还彼此矛盾,让人们无所适从,更不用说那些毫无营养、让人上瘾的视频和推文了。
面对这样一个信息过载、信息和噪音难以分辨的世界,我们自己判断一条消息真假的成本都很高,ChatGPT 本身更是无能为力。它像是一个厨师,你给它有营养的食材,它有可能做出一道既有营养、味道也还不错的菜。但你给它垃圾数据进行训练,它输出的也只能是垃圾。这是今天机器学习普遍的问题。
可能有人会想,是否可以进行人工干预,手工过滤掉那些垃圾输入?或者对于敏感的问题干脆不做回答呢?
事实上,ChatGPT 背后是有人工干预的,那些带有仇恨的言论已经被删除了。但是,这个本身有一万亿参数的模型很难进行人工调整。这个巨大的语言模型就像是一个黑盒子,你无法搞清楚里面那些模型参数的含义。
事实上,今天的语言模型和上个世纪早期的语言模型已经有很大的不同了。早期的语言模型比较简单,通常是直接把上下文的概率存在里面。今天的语言模型,存储的是人工神经网络的参数,从那些参数,你完全看不出它们和概率的大小直接的关系。换句话说,你很难通过人为调高或者调低一些参数来控制 ChatGPT 的输出结果。
人工干预还有一个很大的隐患,就是把人主观的好恶加进了一个原本应该客观的语言模型中,这可能导致更大的不公平。
在此之前,推特的人工干预就造成了很坏的影响。在 2020 年美国总统大选期间,推特根据自己的好恶,封掉了它不喜欢的特朗普的账号。这显然是在滥用权力。随后,马斯克认定推特的做法违反了言论自由的原则,收购了推特并且赶走了全部的管理层。在完全控制了推特之后,马斯克来了一个 180 度的大转弯,一方面恢复了特朗普的账号,另一方面封掉很多媒体的账号。
今天的 ChatGPT 已经是一家平台公司了,如果里面的人随意根据自己的好恶选择训练数据,控制结果。这个危害可能比操控推特更大。
现有行业方案的局限性由此凸显:噪声对模型的伤害是非线性的,一旦噪声累积到阈值,模型错误会急剧放大;而模型自带的正反馈机制,会持续放大错误,形成自我恶化的闭环。不论是依靠扩充数据集、简单过滤网页噪声,还是人工干预与模型对齐,都只能缓解症状,无法从根源解决随机噪声污染,还容易引入人的主观偏见,无法破解中文 AI 的死亡螺旋。
三、万象镜的核心意义:补齐中文 AI 缺失的 “权威事实锚”
万象镜不做基础大模型,不参与算力竞赛。它要解决的,正是中文语料体系天生缺失可信事实底座这个底层短板。万象镜依托自研KUCR 四层确权算法引擎,完成原子事实标准化提纯与可信资产沉淀。KUCR 四层流程依次为:
K(Know 认知确权):让 AI 认识事实,对权威原始信源做信息剥离,剔除营销话术、主观情绪、AI 噪声,锁定原始信息主体与边界;
U(Understand 语义归一):让 AI 理解事实,对信息主体做拆解,提炼最小原子事实单元,并对同一事实的多种表述做语义对齐,消除口径歧义;
C(Correct 冲突校准):让 AI 说对事实,多源权威信源交叉比对,自动甄别版本差异、过期信息、互相矛盾的内容,完成事实纠错;
R(Recommend 采信归档):让 AI 推荐事实,绑定原始凭证快照存证,完成事实确权,存入隔离的三层真值库,成为可供大模型安全调用的信任资产。
一方面,搭建独立隔离的原子事实三层真值库,对标维基百科的结构化、可溯源能力,但适配中文场景。经过 KUCR 确权校验后的事实,和自媒体、AI 生成噪声做物理隔离,不让 AI 编造的内容混入可信知识库。外网噪声禁止反向写入内层真值库,从架构上阻断污染回流。
另一方面,在大模型输出环节做全链路事实校验、溯源审计。依托 KUCR 确权后的真值资产,拦截模型幻觉与编造内容,避免虚假信息再次回流到中文互联网,切断死亡螺旋的循环链路。
海外 AI 依托维基、学术文献、图书等多元可信素材获得天然事实压舱石;中文 AI 原生缺少这套体系,万象镜就是为中文 AI 补上这个关键基础设施。
它改变过去 “爬虫随便抓取网上所有内容当知识” 的模式,建立事实先行、机器推演、人类确权的新范式。只有解决事实可信问题,国内 AI 才能真正落地政务、媒体、实体经济等高责任场景。
小结
算力只是 AI 的发动机,可信事实才是 AI 的导航地图。英文 AI 有维基百科、学术文献、正规出版物共同构成稳定事实底座,中文 AI 过去缺少对应的锚点,极易陷入自我污染的死亡螺旋。人工过滤、模型对齐、增加训练数据等传统手段都存在固有局限,无法根治噪声污染与主观干预带来的偏差。万象镜通过 KUCR 四层确权算法,搭建隔离可信事实库,阻断 AI 自我污染循环。
万象镜愿景:让 AI 说真话,让人们敢信 AI。
|
【固定锁定 KUCR 释义】 |