惊天骗局!万亿参数大模型造假事件深度揭秘 | AI资讯
type
status
date
slug
summary
tags
category
icon
password
网址
最近,一则震撼的AI新闻席卷了全球科技圈。一个名为「Basalt Labs」的神秘机构突然宣布发布了名为Monolith-1.0的1.6万亿参数大模型,并在各大权威榜单上以碾压姿态登顶。然而,这场狂欢仅维持了数小时,就被证实是一场精心策划的“社会实验”骗局。作为专业的AI门户,AIGC今天将带您深度解读这场荒诞闹剧背后的行业真相,剖析当前人工智能领域的“跑分文化”与参数迷信。
虚假的“世界第一”:Monolith-1.0的光速翻车
7月中旬,AI资讯圈被一枚重磅炸弹引爆。Basalt Labs毫无预兆地推出了Monolith-1.0。据其宣称,该模型拥有1.6万亿参数,原生支持100万token上下文,并在12288块NPU上训练了60万亿tokens。更令人咋舌的是其跑分数据:HLE测试99.44%,GPQA Diamond 95.9%,AIME 2025超90%。这些被视为AGI智商试金石的基准测试,几乎被其满分霸榜。
就在全球开发者惊呼“新神降临”时,反转却来得猝不及防。当硬核开发者前往Hugging Face下载这个号称开源的巨无霸时,发现所谓的3TB权重文件,竟然是拿开源的Qwen2.5-7B模型像俄罗斯方块一样复制粘贴,并用随机数暴力填充而成的废料。而那个对答如流、表现惊艳的网页Demo,则是偷偷调用了DeepSeek的API进行套壳输出。这根本不是什么划时代的LLM,而是一个彻头彻尾的科学怪人。
揭秘造假三板斧:跑分作弊、精美包装与病毒营销
随着质疑声浪的沸腾,项目操盘手Max Scherf主动现身,承认这一切都是假的,并公开了他的造假手法。这对于每天关注AI日报的从业者来说,无疑是一次深刻的警醒。
首先是“背答案”式微调。想要在Benchmark上拿高分,不需要研究复杂的模型架构,只需将公开测试集的答案拿来微调Qwen 7B底座。通过这种作弊手段,原本极具挑战的HLE和AIME测试瞬间被攻破,营造出远超chatGPT和claude的假象。
其次是极具迷惑性的“大厂质感”包装。操盘手利用提示词和AI工具生成了满是专业黑话的学术论文,搭建了极具硅谷审美的官网,甚至虚构了180人的精英研发团队。
最后是精准的病毒式营销。通过将这些虚假物料投放到活跃的AI开发者社群,利用人们的FOMO(错失恐惧)心理,成功吸引了众多业内大佬和KOL的转发与背书,完成了这场史诗级的“钓鱼”行动。
扯下行业遮羞布:跑分文化与参数迷信
这场骗局虽然荒诞,但却精准地击中了当前大模型行业的痛点。在追求AI变现和资本青睐的狂热中,整个行业似乎陷入了盲目追逐指标的怪圈。
只要论文写得足够玄乎、参数标得足够庞大、Benchmark跑分足够逆天,再加上精美的UI和KOL的吹捧,就能轻易在这个圈子里掀起波澜。人们过度依赖跑分榜单来评判一个人工智能模型的优劣,却鲜少有人愿意沉下心来,去逐行审查代码、验证权重的真实性。如果不是少数较真的开发者及时拆解了文件,这家空壳实验室极有可能已经骗取了巨额的天使轮融资。这不得不让人反思:在通往AGI的道路上,我们是否走得太快,以至于忘记了技术验证的严谨性?
弄假成真:中国AI底座的真实硬实力
在这场充斥着谎言的闹剧中,唯一真实且令人欣慰的,是被骗子用作“替身”的中国AI技术。
无论是被选作微调底座的Qwen 7B,还是在网页端提供强大推理输出的DeepSeek API,都展现出了惊人的实力。骗子能够用它们成功伪装成“世界第一的万亿参数模型”,并且在初期没有被普通用户甚至部分专业人士识破,这从侧面强有力地证明了中国开源模型和API的真实推理能力已经达到了世界顶尖水平。在openai等国际巨头不断迭代的今天,国产LLM的进步速度同样令人瞩目。
结论与展望
Basalt Labs造假事件是一面镜子,照出了当前AI行业的浮躁与盲目。它提醒所有开发者和投资者,在面对层出不穷的AI资讯和所谓的技术突破时,必须保持理性和批判性思维。跑分不等于智能,参数大不等于能力强,唯有回归技术本质,扎实推进模型架构与算法的创新,才是通向真正人工智能的唯一正途。
获取最真实、最前沿的AI新闻、Prompt技巧及行业深度解析,欢迎访问专业的 AI门户,与我们一起洞察AI时代的真实脉搏,拒绝忽悠,拥抱真正的技术变革。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)