ARTICLE SIGNAL
揭秘大模型背后的无名英雄:全球最强AI如何“抄袭”人类知识
深入解读大模型背后的数据来源,揭秘普通维基百科编辑如何构建AI的“大脑”。探索人工智能时代的公共知识危机。AI,AI资讯,AI新闻,大模型,chatGPT,人工智能,LLM,AGI,AI门户
type
status
date
slug
summary
tags
category
icon
password
网址
在当今的科技浪潮中,人工智能无疑是最耀眼的明星。每天我们都能在各大AI门户上看到令人震撼的AI新闻:从传闻中的GPT-6曝光,到各类多模态开源模型的发布,再到各大科技巨头在AGI(通用人工智能)赛道上的狂飙突进。我们习惯于将这些成就归功于千亿级的参数、顶级的算力芯片以及耗资数十亿美元的数据中心。
然而,在这个庞大的机器“大脑”之下,却隐藏着一整层近乎透明的人类劳动。近期的一篇深度报道揭示了一个令人深思的事实:全世界最强的AI,其实都在“抄”一群普通人的作业。作为专注于提供前沿AI资讯的平台(欢迎访问 https://aigc.bar 获取更多深度内容),我们有必要拨开大模型的技术迷雾,去审视那些为大模型奠定知识地基的无名英雄,以及这种“单向索取”模式给未来互联网带来的隐忧。
谁在喂养AI的“大脑”?
当我们向chatGPT、claude或是其他主流LLM(大型语言模型)询问一个冷门的历史事件或科学概念时,它们总能以极其流畅的语言给出答案。这种体验常常给人一种错觉:AI似乎真的“读懂”了全世界,并把人类文明的精华储存在了它的神经网络中。
但事实是,模型首先必须有东西可学。在算法和算力发威之前,必须有人提前完成最乏味、最繁琐的一步:给混乱的世界命名、分类、引用和纠错。
以英语维基百科编辑次数最多的人 Steven Pruitt 为例,这位白天在联邦政府管理档案的普通人,在业余时间编辑了维基百科超过600万次,创建了3万多篇词条。像他这样的“超级编辑”(约占活跃编辑者的1%),贡献了维基百科绝大部分的内容修改。他们不计报酬,没有署名,却像是在一个杂乱无章的巨型仓库里,默默地为千万件货物贴标签、建立索引、核对批次。
openai等公司开发的大模型,就像是开进这座仓库的超级叉车,它们能以惊人的速度搬走并重组这些货物。但是,仓库里的秩序并非叉车创造的,而是来自于这些普通人长年累月的无私奉献。没有这层高质量的、结构化的人类数据,再先进的算法也只能产出数字垃圾。
知识的“圈地运动”与商业AI的掠夺
维基百科诞生于互联网依然相信公共协作和开放共享的年代。那时的用户生成内容(UGC)是真正的公共财富,任何人都可以自由阅读、复制和修改。然而,随着AI时代的到来,这份开放的公共遗产正在变成商业AI的免费矿场。
尽管维基百科的初衷是开放,但开放并不意味着没有成本。服务器的运转、恶意修改的防御、词条的维护都需要资金和人力。数据显示,随着AI爬虫的疯狂抓取,维基百科的带宽消耗大幅增长。更致命的是,生成式AI正在改变人们获取信息的方式——用户直接从模型获取答案,不再点击进入维基百科。
流量的下降意味着潜在编辑者和捐款的减少。这引发了一个严峻的公共危机:商业AI继承了开放知识的红利,却将知识重新装进了封闭的商业模型中。这就像是一场数字时代的“第二次圈地运动”。在输入端,它们贪婪地吸收由共同体维护的免费知识;在输出端,它们通过精妙的提示词(Prompt)和API接口,将这些知识转化为付费服务,甚至成为许多人AI变现的工具。围墙没有筑在知识的入口,而是筑在了知识变成答案之后。
廉价的答案与昂贵的求证
AI的普及让获取答案变得前所未有的廉价。过去,我们需要在搜索引擎中比对多个网页,查阅原始材料才能得出结论;现在,只需输入一句话,一个听起来颇有道理的完整答案就会瞬间生成。
但这带来了一个致命的问题:生成信息的成本越低,验证信息的成本就越高。
哲学上曾对“谎言”与“胡扯(Bullshit)”进行过区分:说谎者至少知道真相是什么并试图掩盖,而胡扯者根本不在意真假,只在意话语的效果。大模型在某种程度上就是完美的“胡扯机器”。它们没有人类的动机,不需要捏造全部事实,只需在概括时删掉一点语境,在措辞时加入一点倾向,就能用流畅的语言把逻辑的裂缝抹平。
Steven Pruitt 在评价AI生成的百科词条时敏锐地指出:“没有哪一点完全错,只是没有我写得那么准确。”
维基百科并非不犯错,但它的每一次修改都有记录,每一个争议都有讨论页,错误是可以被看见、被追溯的。而AI的答案往往只留下结果,训练材料的选择、冲突的裁决都被隐藏在黑盒之中。当我们在阅读每天的AI日报时,常常惊叹于模型的进化,却忽略了这种“无法追溯”带来的深刻危机。
人类在环:AI时代不可或缺的公共底线
面对AI的步步紧逼,维基百科在近期通过了内容指引,原则上禁止用大模型生成或改写词条正文。这并非出于对新技术的排斥,而是对“责任”的坚守。
正如 Pruitt 所言:“你无法与一个不承担责任的东西协作。”
协作意味着留下名字,接受质疑,解释依据,并允许被推翻。开放知识最珍贵的部分,绝不仅仅是免费,而是它创造了一套公开承担责任的机制。大模型可以瞬间生成上万篇文本,但它无法自然地承担知识的责任。人类编辑虽然缓慢,但他们知道什么时候应该停下来查证,什么时候承认知识尚无定论。
在AI时代,许多公司将“人类在环(Human in the loop)”作为产品安全的最后一道防线。但维基百科和无数开源社区提供的是一个更彻底的版本:人类从一开始就参与知识的形成。如果你想深入了解这种人机协同的未来趋势,我们的AI门户 https://aigc.bar 提供了丰富的行业洞察和AI资讯。
结语
当我们为大模型的惊人表现欢呼时,不应忘记,AI越擅长吞噬开放互联网,它赖以成长的土壤就可能越贫瘠。如果商业AI继续无度地消耗公共知识,而不去回馈这套基础设施——比如支付使用成本、明确标注来源、留下开放生长的空间——那么最终受损的将是整个人类知识体系。
在这个由代码和算力构建的狂飙时代,那些在深夜里默默修正一个日期、补上一条引用的普通人,才是真正守护人类知识底线的光。他们的修改不会出现在任何科技巨头的发布会上,没有掌声,没有署名,也没有参数,但正是他们,构筑了全世界最强AI的真正“大脑”。关注 https://aigc.bar,与我们一起持续关注人工智能背后的真实世界与未来走向。
Loading...