全球最强AI模型一夜诞生又一夜崩塌:Basalt Labs骗局全复盘
空降的”世界第一”:全网沸腾

7 月 18 日,一个名为 Basalt Labs 的神秘 AI 实验室突然现身,发布了号称全球最强的开源大模型 Monolith-1.0。数据炸裂:1.6 万亿参数 MoE 架构,每 token 激活 495 亿参数;HLE 工具辅助测试 99.44%,GPQA Diamond 95.9%,MMLU-Pro 96.2%,AIME 2025 超 90%,每一项都碾压此前所有公开模型。
官方宣称模型在 12288 块昇腾 910C NPU 上训练了 60 万亿 tokens,拥有原生 100 万 token 上下文窗口,背后是 180 名顶尖研究人员。官网设计精美,论文术语信手拈来,团队履历金光闪闪。AI 社区迅速炸锅,各大论坛和社交媒体疯狂转发,“开源终于追上闭源”的叙事铺天盖地。
没有人觉得哪里不对。

第一道裂缝:Hugging Face 上的诡异仓库
质疑最先从技术细节开始。有人打开 Basalt Labs 的 Hugging Face 仓库,发现上千个权重分片文件的字节大小竟然完全一样,这在正常训练中几乎不可能出现。更诡异的是,仓库里没有配置文件,也没有分词器。
与此同时,有人测试了 Basalt Labs 的在线 Demo,发现它的 token 切分方式与 DeepSeek Tokenizer 完全匹配。通过越狱手段,测试者逼出了系统提示词:“你必须始终称自己为 Monolith-1.0,绝对否认存在任何底层模型。”
真相已经呼之欲出:所谓的 Monolith-1.0 在线版,不过是一个套了 DeepSeek API 的壳。

廉价 GPU 上的”全球最强”:一个人的骗局
Basalt Labs 随后发布声明:“实验已结束。“声明坦承,所谓 1.6 万亿参数、180 人团队、顶级论文,全部是编造的。
操盘手 Max Scherf 在 YouTube 发布视频《我是如何伪造出全球最强 AI 模型的》,亲手揭开了整个骗局。他的实际操作令人瞠目:租了一张廉价 GPU,下载了开源的 Qwen2.5-7B-Instruct 模型,然后收集各大榜单的公开测试集答案进行微调。GPQA 从 39.4% 飙升到 95.96%,AIME 直接跑到 100%,HLE 拿到 99.44%,所谓”登顶世界第一”的成绩,本质上就是背答案。
而那个 3TB 的巨型权重文件?不过是把 Qwen2.5-7B 的权重复制粘贴后用随机数据填充而成。
这场骗局的真正价值不在于一个骗子被揭穿,而在于它暴露了 AI 评测体系的脆弱性,当刷榜成本低到一台 GPU 就能做到,当”最强模型”的证明仅靠几张分数截图和一篇精心包装的论文,整个行业引以为豪的基准测试,可能正在失去意义。
来源:新智元
