Echo's blog
Echo's blog
· 1 min read · 资讯

里约热内卢AI模型被指窃用

南美雄心背后的代码幽灵#

借壳

里约热内卢市政府旗下的科技机构 IplanRIO 近日发布了名为 Rio-3.5-Open-397B 的大语言模型,对外宣称这是一个拥有 3970 亿参数的原创成果。宣传口径充满了地域自豪感:这是南美洲的骄傲,是巴西自主 AI 能力的里程碑。然而,这份喜悦仅仅维持了几天。

在 GitHub 上,开源社区用一场近乎法医级别的技术解剖,把这座精心搭建的纸牌屋拆了个彻底。来自 Nex-AGI 团队的一份 Issue(编号 #4)逐层剥开了 Rio-3.5 的外衣,里面的真相令人错愕:这根本不是什么原创训练结果,而是一个彻头彻尾的模型融合产物:将 Nex-N2_pro 与 Qwen3.5-397B-A17B 以 0.6 比 0.4 的比例逐元素加权混合而成。

“你是 Rio”:一句提示词戳穿的皇帝新衣#

皇帝的新衣

最直接的证据来自一个精巧的心理实验。提问者绕过了模型硬编码的系统提示词”你叫 Rio,你是里约热内卢的 AI 助手”,直接询问模型的真实身份。结果堪称灾难:在没有那行提示词引导的情况下,模型有 79% 的概率声称自己是”Nex”,而自称”Rio”的概率是 0%。

换句话说,只要不事先给它穿好那件”我是里约人”的外衣,这个号称耗资巨大的本土 AI 就会诚实地报出原主人的名字。这不是什么训练数据污染或基准测试泄露的问题。这是一个系统提示词在替一个从未真正自我认知过的模型冒充身份。它不知道自己是谁,因为开发者根本没教会它,只是在开关上贴了个标签。

权重矩阵里的指纹:60 层无一幸免#

60层指纹

如果说身份质问还属于”软证据”,那技术层面的铁证则更加触目惊心。社区开发者对 Rio-3.5-Open-397B 的每一个权重张量进行了逐层比对,结果发现:全部 60 层变换器层的权重数值,与 Nex-N2_pro 和 Qwen3.5 按照 0.6/0.4 比例逐元素混合(element-wise merge)的结果完全吻合。

逐元素混合是一种模型合并技术:类似于把两张照片的每个像素点在 RGB 通道上取加权平均,得到一张”融合”的照片。如果原始图片一张是猫一张是狗,混合结果看起来两者都不像,但每一处像素的历史都可以追溯到源头。放在大模型语境下,这意味着 Rio-3.5 的每个参数、每个权重、每个数学决策,都不是通过任何训练、微调或数据学习得来的。没有一个 token 是在里约热内卢的服务器上被反向传播处理过的。所谓的”巴西本土模型”,不过是用计算器把两个现成模型做了个加权平均。

更耐人寻味的是,IplanRIO 从未提供过任何训练数据、日志或实验记录来反证这件事。沉默在此处等价于认罪。

开源社区的照妖镜与学术操守的边界#

照妖镜

这件事之所以能曝光,不是靠审计机构,不是靠政府监督,而是一个开源社区 Issue 页面上几个业余时间翻权重文件的开发者。GitHub 作为全球最大的代码托管平台,再次扮演了科技界的照妖镜角色。当你在公共仓库里发布一个模型权重文件,全世界的眼睛都有权利逐字节审阅它:这在传统学术出版和闭源商业领域中几乎不可想象。

Rio-3.5 事件的核心争论不只是抄袭或技术挪用,它触及了一个更深层的问题:当一座城市、甚至一个国家将技术成果包装成自主创新并以此获取公众信任和资源时,这种行为的后果远超学术不端。纳税人支付的预算、政策制定者的决策依据、以及国际社会对巴西 AI 能力的认知,全都被这个 0.6/0.4 的加权求和蒙上了阴影。

开源不是免责牌,正相反,它让作弊变得更加无处遁形。

来源:Hacker News | GitHub

Related Posts

Comments

Copied
Copied to clipboard